GPT-6 Sol 对比 Luna:OpenAI 两款低价模型该怎么选?

这篇攻略用最直接的方式对比 GPT-6 Sol 和 GPT-6 Luna:同样的提示词同时发给三个模型,计时与费用实时结算,实测过程取材自 AI with Surya 的三模型 Arena 对比视频,官方定价图表取自 Matthew Berman 的首发解读,并与 OpenAI 公告交叉核对。Sol 是旗舰 GPT-6 Astra 之下的中档位,Luna 以每百万输入 token 0.10 美元担任预算主力。下文依次讲清两款模型的入口位置、真实成本、Sol 拉开差距的场景,以及 Astra 仍然值得付费的时机。

来源与致谢

本教程的截图来自 AI with Surya 的公开演示视频。每个步骤都链接到视频中的对应时间点,方便你对照学习。

AI with Surya ↗

9 月 22 日到底发了什么

  1. 1

    认清阵容:三个模型同日发布

    9 月 22 日是个三模型之日:Anthropic 发布 Claude Opus 5.5,OpenAI 在几小时内跟进 GPT-6 Sol 和 GPT-6 Luna。两款新模型都排在 9 月初发布的旗舰 GPT-6 Astra 之下,训练方法也与 Astra 同源。卖点一句话:保留 Astra 的大部分能力,把价格大幅打下来。

    三枚卡通火箭并排点火升空,箭体分别标注 Opus 5.5、GPT-6 Sol 与 GPT-6 LUNA,对应 9 月 22 日的模型发布潮
    Opus 5.5、Sol、Luna,前后脚在同一天落地。视频 0:03 处
  2. 2

    先看真实业务任务的成绩单

    发布日的数据把三个模型放在同一架梯子上。AutomationBench 业务任务测试里,Claude Opus 5.5 以每百万输出 token 20 美元的代价完成 40% 的任务,GPT-6 Sol 以 10 美元完成 33%,GPT-6 Luna 以 0.50 美元完成约 21%。Sol 用一半价格只让出 7 个百分点,Luna 让出更多分数,换来近乎免费的单价。

    AutomationBench 发布日图表:Claude Opus 5.5 完成 40%、GPT-6 Sol 完成 33%、GPT-6 Luna 完成约 21% 的业务任务
    同一架梯子,三个价位:完成率 40%、33%、约 21%。视频 2:07 处
  3. 3

    记住这次降价:两款都只要 GPT-5.6 的一半

    OpenAI 把这一对模型的 API 价格砍掉 50%,而且是在 GPT-5.6 Luna 已经降过 80% 的基础上再降。GPT-6 Sol 从每百万输入 token 4 美元降到 2 美元,输出从 20 美元降到 10 美元;GPT-6 Luna 从 0.20 美元降到 0.10 美元,输出从 1.20 美元降到 0.50 美元。按 token 计价,Sol 是中档主力,Luna 则是 frontier 家族里罕见的白菜价。

    OpenAI 降价幻灯片:GPT-6 Sol 每百万输入 token 2 美元、输出 10 美元,GPT-6 Luna 0.10 美元与 0.50 美元
    Sol 2/10 美元、Luna 0.10/0.50 美元:都比 GPT-5.6 便宜一半。视频 1:26 处

三模型 Arena 对比环境

  1. 4

    自己搭一套同款三模型对比

    对比视频用的是一个自建的 Model Arena 页面:同一条提示词同时发给 Claude Opus 5.5、GPT-6 Sol 和 GPT-6 Luna,按模型分别统计 token、耗时和实时费用。三个模型都经 OpenRouter 接入,所以不用 OpenAI 的 key 也能复刻这套环境。三列保持相同设置,比赛才算公平。

    Model Arena 仪表盘上 Claude Opus 5.5、GPT-6 Sol 与 GPT-6 Luna 三列并排,等待第一条提示词
    一条提示词进去,三场赛跑出来:各自计时计费。视频 2:30 处
  2. 5

    提示词只写一次,三个模型一起跑

    每个任务只在提示词构建器里输入一次,同时派发给所有模型,一锤定音、不做重试。第一条任务要求给虚构雨伞品牌 Squall 做一个单页网站:带动画、客户评价和预购区块,不允许引用外部图片。盯着三列同时流式输出,是感受 Luna、Sol 与 Opus 速度差的最快方式。

    Model Arena 的提示词构建器面板,Squall 雨伞品牌的任务简报列在 Run all three 按钮上方
    Squall 简报:单页、带动画、带评价、带预购,零外部图片。视频 6:45 处

价格与速度的实测账单

  1. 6

    解读第一测:落地页,几分钱还是几毛钱

    雨伞落地页已经把价格故事讲完了。GPT-6 Luna 用时 1 分 22 秒、花费 0.0005 美元;GPT-6 Sol 用时 1 分 48 秒、花费 0.18 美元;Claude Opus 5.5 用时 3 分 25 秒、花费 0.83 美元。三份成品都能打开,评价区和预购块齐全,差别在打磨程度:Opus 的暴雨动画最华丽,Sol 多了音效反馈。

    第一测的结果行:GPT-6 Luna 0.0005 美元、GPT-6 Sol 0.18 美元、Claude Opus 5.5 0.83 美元并列展示
    同一个页面,三张账单:0.0005、0.18 和 0.83 美元。视频 6:00 处
  2. 7

    解读第二测:风暴仪表盘的成本鸿沟

    风暴追踪仪表盘把差距拉得更开。GPT-6 Luna 1 分 41 秒交付、花费 0.0073 美元;GPT-6 Sol 1 分 49 秒、0.12 美元;Claude Opus 5.5 跑了 9 分 17 秒,烧掉 30.0k 思考 token 加 63.7k 输出 token,账单 1.27 美元。同一份需求,Opus 的成本是 Luna 的 150 多倍、Sol 的 10 倍左右,换来三份成品里最精致的交付。

    风暴仪表盘一战的计时与账单:Claude Opus 5.5 用时 9 分 17 秒花费 1.27 美元,旁边是 0.12 美元的 GPT-6 Sol 与 0.0073 美元的 GPT-6 Luna
    Opus:9 分 17 秒、1.27 美元;Sol:0.12 美元;Luna:0.0073 美元。视频 10:35 处
  3. 8

    下单前先核对官方 API 定价

    OpenAI 官方定价表就是做预算的依据:gpt-6-sol 每百万输入 token 2 美元、输出 10 美元;gpt-6-luna 输入 0.10 美元、输出 0.50 美元。两行都挂着比 GPT-5.6 前代便宜 50% 的标签。同一份公告也明确了 GPT-6 Astra 的位置:要最好的结果、不妥协的体验,仍然选它。

    GPT-6 API 官方定价表:Sol 每百万 token 2 美元与 10 美元,Luna 0.10 美元与 0.50 美元,均标注便宜 50%
    模型 ID:gpt-6-sol 与 gpt-6-luna;Astra 依旧是不妥协选项。视频 0:45 处
  4. 9

    把三家放到一张图里,含 Opus

    把 9 月 22 日的阵容与 Claude Opus 5.5 画在一起,档位一目了然。每百万 token 输入价:Luna 0.10 美元、Sol 2.00 美元、Opus 5.5 4.00 美元;输出价:0.50、10.00 和 20.00 美元。最大努力档下的公开基准也是同一排序:FrontierCode v1.1 Main 得分 42.4%、49.3%、54.4%,AutomationBench 得分 20.7%、33.2%、40.0%。

    四张条形图对比 GPT-6 Luna、GPT-6 Sol 与 Claude Opus 5.5 的输入价、输出价、FrontierCode 与 AutomationBench 得分
    价格档位与得分档位同步排列:Luna、Sol、Opus 5.5。视频 5:02 处

质量差距:一个仪表盘,一款 3D 游戏

  1. 10

    看 Sol 改道成功,Luna 原地卡死

    质量差距在跑分之前就看得见。风暴仪表盘任务里,Luna 的版本把卡车一遍遍派回风暴区,排程始终没能恢复;Sol 则把进入风暴的卡车标红,redirect 按钮真的会重新规划路线,压低风险交付数。凡是模型需要理解状态并做决策的工作流,这才是要紧的差距。

    GPT-6 Sol 的风暴仪表盘:红色风暴团与被标红的受困卡车,等待一键改道
    Sol 的仪表盘:进风暴的卡车标红,改道真的生效。视频 8:15 处
  2. 11

    第三测评分:一条提示词写 3D 游戏

    Storm Run 是自带完整规则的 3D 帆船游戏,也是最难的一条提示词。GPT-6 Luna 用 1 分 30 秒、0.0075 美元做出能跑的东西;GPT-6 Sol 花了 2 分 17 秒、0.18 美元;Claude Opus 5.5 用掉 18 分 07 秒、74.9k 思考加 123.1k 输出 token、2.47 美元。成本与野心同涨,多出来的钱有没有买到东西,看下面三张截图。

    Storm Run 一战的三档账单:GPT-6 Luna 0.0075 美元、GPT-6 Sol 0.18 美元、Claude Opus 5.5 2.47 美元
    一款 3D 游戏,三档预算:0.0075、0.18、2.47 美元。视频 12:15 处
  3. 12

    看清 Luna 的天花板:快、便宜、毛坯

    Luna 的 Storm Run 秒开,HUD 正常工作,但海面是一块没有纹理的灰色平面,天气效果只剩几缕雨丝,谈不上可玩。与仪表盘测试同一个模式:Luna 交出任务的形状,然后停手。对原型、草稿和内部工具来说,这往往已经够用。

    灰平无纹理的海面和裸露的 HUD:GPT-6 Luna 版 Storm Run 帆船游戏几乎没有水体质感
    Luna 的船以 8 km/h 航行在一片近乎不存在的海上。视频 11:58 处
  4. 13

    看 Sol 的进步:真正能玩的游戏

    Sol 的版本有真实的水体、波浪起伏、风向系统,还有一条完整赛道:八个浮标、标示下一标的橙色光点、不断递减的方位角读数。这就是毛坯与成品的差别。Sol 的 0.18 美元买到了玩法,Luna 的 0.0075 美元买到一个会动的加载画面。

    GPT-6 Sol 版 Storm Run:蓝绿海水、成串浮标、橙色光点标记与通往下一标的方位读数
    跟着橙色光点走:Sol 的版本是真正的游戏。视频 12:45 处
  5. 14

    看看旗舰多花的 2.29 美元买到了什么

    Opus 5.5 的 Storm Run 是全场演示:动态海水、穿过风暴云的阳光、随浪起伏的镜头,还有游戏会主动预警的 killer wave 事件。这些在两款低价版本里都不存在。这也是贵档位存在的理由最直观的一帧:当质量本身就是产品时,用它。

    暗色风暴海面上方弹出 killer wave 预警,帆船正在穿浪:Claude Opus 5.5 版 Storm Run 的渲染水准
    Killer wave 来袭:旗舰档能渲染出低价档做不出的天气。视频 14:15 处

GPT-6 Astra 对比 Luna:旗舰何时仍值得买

  1. 15

    全面降级之前,先读一遍 Astra 那条线

    在 OpenAI 的 FrontierCode 图上,Astra 的曲线在每一档努力等级都压着 Sol,连低努力的 Astra 都能以每任务 1.70 美元拿到 45.3%。对照 Luna 最大努力档的 42.4%、每任务约 0.11 美元,规律浮现:Luna 用几个点的能力换约 15 倍的成本优势。任务落在这条线附近时,Astra 低努力档是值得一试的中间路线。

    FrontierCode 图表提示框:GPT-6 Astra 低努力档以每任务 1.70 美元拿到 45.3%,压在 Sol 与 Luna 上方
    Astra 低努力档:45.3%、每任务 1.70 美元,中间路线。视频 4:16 处
  2. 16

    用 Astra 对比 Luna 的矩阵做决定

    电脑操作是 Astra 与 Luna 差距最大的场景:OSWorld 2.0 离线任务上,Luna 最大努力档拿到 52.7%、每任务 0.27 美元,Astra 的曲线顶端约 73%。首发报道给出的经验法则是:日常九成到九成五的任务交给 Luna;对质量敏感又嫌 Astra 贵的自动化交给 Sol;最难的推理、代码与智能体工作留给 Astra,因为答错的代价高过省下的 token。

    OSWorld 2.0 离线图表:GPT-6 Luna 拿到 52.7%,GPT-6 Astra 曲线顶端接近 73%,电脑操作差距一目了然
    Luna 最大档 52.7%,Astra 约 73%:电脑操作差距最大。视频 4:46 处

常见问题

继续探索