Internal Evaluation · AI Coding Assistants

四款 AI 编程助手
真实交付能力对比

同一条指令,分别交给 Antigravity、Codex、Kiro 与 GitHub Copilot, 在三个贴近实际工作的场景里各自独立完成。所有产出都原样嵌入本站, 可以直接点开试用——不看宣传,只看交付物。

评测结论

三场评测,各自发生了什么

每个场景对模型的考验不同:游戏考验交互与状态管理,编年史考验信息架构与视觉表达,数据看板考验图表能力与数据处理。下面是逐场的核心结论。

三个测试场景

点进任意场景可以直接试用四个模型的原始产出,并查看该场景的评分明细与能力雷达图。

综合评分表

按总分降序排列。每个场景 6 项维度、每项满分 10 分。

六维能力分布

取各已完成场景的维度均分

评分维度

每个维度独立打分(0–10),由同一名评估者在相同环境下人工体验后给出,避免跨人标准漂移。