GPT-5.6 入驻 AWS Kiro:单价仅降 20%,单任务成本却砍掉八成

AI 前沿GPT-5.6入驻 AWS…openstarry.com

一组让账单说话的数据

单看官方调价,GPT-5.6 Terra 最近一次降价发生在 7 月 30 日,幅度只有 20%。但到了 8 月 24 日 OpenAI 与 AWS 公布的联合测试结果里,Terra 在 Terminal-Bench 2.1 上完成一个成功任务的成本降了约 82%。

Terminal-Bench 2.1 不像传统基准只让模型答卷。它把模型丢进一个真实的终端环境,给一个模糊目标,让它自己规划路径、调工具、写脚本、处理报错并反复迭代。榜单右侧的"成本"列和左侧的"准确率"列同样重要。

同一份榜单上四组对比最具冲击力:

前两行准确率只差 0.7 个百分点,账单却差了将近 4 倍;后两行用的同一档模型体系,准确率低 2.7 个百分点,费用只有六成左右。这说明在编程智能体场景下,"花多少钱做完一件事"开始和"做对了多少"一样值得关注。

八成的成本从哪省出来:三个层级的协同

单价降 20%、账单降 82%,中间的 60 个百分点才是真正的看点。OpenAI 把编程场景的成本结构拆成了三层:

Terra 最近一次公开降价只有 20%,剩下那块大幅降本主要落在前两层和模型使用方式上。更直白地说,少烧的是"原本会白花的 token"——智能体跑偏后兜圈子再回头、选错路径反复试错的中间步骤,以及失败后的重试。

可以把这个过程理解为:折扣调的是菜单价,省下的则是点多了又退掉、做完才发现点错的那部分钱。

同一个模型、不同框架,账完全不一样

Terminal-Bench 2.1 跑的是"智能体 + 模型"的组合,而不是裸模型。同一个 GPT-5.6 Terra,放进 Kiro 得到的分数是 78.4% / 421.15 美元;放进 Codex 得到的是同档准确率但完全不同的上下文组织和工具策略。

这层差异在编程场景里非常关键,因为多数 token 消耗来自智能体框架如何描述任务、工具如何被调用、出错后怎么恢复,而不是模型单次回答时用了多少字。模型选型和框架选型开始被绑在一起评估。

Kiro 的 spec-driven 打法:把任务规整化再交给模型

Kiro 把用户体验切成了三个入口:IDE、CLI、Web。它的核心策略可以概括成一句话——不许上来就写代码。

具体流程是:先把用户那句含糊的目标拆成正式的需求文档、技术设计、可执行任务清单,再交给模型执行;代码真正落下去之前留一道闸让人过一眼;任务完成后再自动跑一轮测试做验证。这一套机制直接吃掉了"最贵的开销"——返工与推倒重来。

按 Kiro 官方数据,Terra 在 Coding Agent Index 上拿到 77.4,只比 Claude Fable 5 的 77.2 高一点点。它的卖点不在分数本身,而在于支撑这一分数的账单。

三档模型分工:Sol 定计划、Luna 做执行

GPT-5.6 家族在 Kiro 里分 Sol、Terra、Luna 三档。它们不是简单的"快慢配",而是能力档位的区分。

一种被官方举例的工作流是:先用 Sol 把问题想清楚、定好计划,再切到 Luna 去执行那些已经定义清楚的改动、写测试、跑评估。同一段流水线,不同环节配不同档位的智能,可以避免"用最贵的那档去做最机械的那段"。

7 月 30 日 OpenAI 调价落地后,Kiro 次日跟进更新了倍率:Luna 从 0.6 倍砍到 0.1 倍,Terra 从 1.2 倍降到 1.0 倍,Sol 未动。账面上看,三档都明确标了价,分别对应规划、执行与中间档三种使用方式。

如何用起来:接入路径与上手建议

GPT-5.6 在 Kiro 的可用性受多重要素限制,需要提前了解:

上手建议:

  1. 先用 Luna 跑已经定义清楚的子任务,例如补测试、改造字段、写固定模板的脚本。Luna 在 Kiro 里的倍率被砍到 0.1 倍,单次成本最低。
  2. 涉及架构选择、跨模块改动、需求拆分时切到 Sol,因为这类任务前期规划成本最高。
  3. Terra 介于两者之间,适合做主力模型。如果团队刚开始评估,建议先用 Terra 跑一两周拿到自己的真实基线,再决定要不要在规划环节换 Sol、执行环节换 Luna。
  4. 在 Kiro 里同样要走 spec 流程:把目标交上去之后,先看 Kiro 生成的需求文档和任务清单再放行,不要直接跳过这一步。

局限与边界

回到那组对比数据,要把结论限定在它能支撑的范围内:

编程场景里真正改变的是评价标准:分数高不再默认能赢,花钱少同样能赢。在挑模型之前,更值得先问一句——"让这套组合把这件事做完,我到底要花多少。

以 AI 之力,筑未来之境

现在注册,立即免费获赠 200 次大模型调用权益

免费注册 →