GPT-6 vs Gemini 3:旗舰对决,到底该用哪个?

今年 9 月,OpenAI 的 GPT-6 Astra 和 Google 的 Gemini 3.8 Flash 前后脚发布,但它们根本不是为同一类人准备的。AI News 的三方基准图里,Astra 在 Terminal-Bench 4.0 上拿下 57.9%,Gemini 3.8 Flash 只有 19.1%;可在价格上,3.8 Flash 的 API 便宜约 13 倍,输出速度还排名全场第二。这篇实战对比带你逐项看完,选对模型。

来源与致谢

本教程的截图来自 AI News 的公开演示视频。每个步骤都链接到视频中的对应时间点,方便你对照学习。

AI News ↗

相隔一天发布的两面旗舰

  1. 1

    一场发布周,引出这场对决

    这轮对决的主角都在 9 月登场:Google 在 9 月 2 日发布 Gemini 3.8,OpenAI 隔天跟进 GPT-6 Astra,而 Anthropic 的 Claude Fable 5.1 还要早一天。两家也都备好了更便宜的兄弟型号——OpenAI 在 9 月 22 日追加 GPT-6 Sol 和 Luna,Google 则把 3.8 拆成公开的 Flash 和受限的 Cyber 两个版本。这篇指南只解决旗舰之争:GPT-6 Astra 对 Gemini 3.8 Flash。

    NasBuilds 的发布回顾里出现一张深色标题卡,依次列出 9 月 1 日、9 月 2 日和 9 月 3 日,正是这轮模型大战的三个发布日。
    三天三场发布,拉开了 GPT-6 对 Gemini 3 的大幕。视频 0:08 处
  2. 2

    GPT-6 Astra 是什么:交得出成品的旗舰

    OpenAI 的发布演示说明了 Astra 为什么定位最高:它在 Blender 里建好一栋房子,再转成可行走的 Unreal Engine 5 场景,客户在开工前就能进屋逛一遍。同一篇发布文章还给出 BenchCAD 95.9% 的成绩,把物体转成 CAD 代码的能力明显超过 Claude Fable 5.1 的 84.3%。这是一个面向成品交付、而不是闲聊回复的模型。

    OpenAI 的发布演示里,Blender 建模工作区选中了一栋现代住宅和树木,顶部标签显示即将转入可行走的 Unreal Engine 场景。
    Astra 发布演示:从 Blender 模型到可参观的 Unreal Engine 场景。视频 0:30 处
  3. 3

    Gemini 3.8 是什么:Gemini 应用里的快手主力

    Google 的答案就放在 Gemini 应用里:新建对话时,选择器里就是 Gemini 3.8 Flash,Google AI Pro 和 Ultra 订阅用户在 Gemini 应用和 AI Mode 里用的也是它。Artificial Analysis 测得它的输出速度约每秒 293 个 token,排名全场第二,而 Astra 只有约 54。它的卖点就是快——用旗舰几分之一的价钱做推理、写代码、跑智能体。

    Gemini 应用首页显示 New Conversation 输入框,已经打了一个目标提示词,模型选择器停在 Gemini 3.8 Flash 上。
    在 Gemini 应用的模型选择器里,Gemini 3.8 Flash 一步就能选中。视频 3:50 处
  4. 4

    先分清你说的是哪个 Gemini 3.8

    Gemini 3.8 其实分成两个型号,开放程度完全不同。Gemini 3.8 Flash 是面向写代码、推理和智能体的通用主力;3.8 Flash Cyber 则是安全特化版,只通过 Google 的 Fairwind 计划开放给经过审核的防御者。真正能随意调用的只有 Flash,所以这场对决里登场的就是它。

    NasBuilds 的讲解图把 Gemini 3.8 Flash 拆成 BUILD 和 DEFEND 两张卡片,把通用模型和安全特化的 Cyber 版分开。
    同一个 Gemini,两种分工:公开的 Flash 和只给防御者的 Cyber。视频 5:43 处

正面对决:基准测试说明了什么

  1. 5

    智能体编程:Terminal-Bench 4.0 三模型同台

    在 AI News 的三方基准图里,Terminal-Bench 4.0 这种长链条编程智能体任务的结果是:Astra 57.9%,Claude Fable 5.1 55.8%,Gemini 3.8 Flash 只有 19.1%。其中 57.9% 这个数字,OpenAI 官方发布页上也写得一模一样。如果你的工作是把整个工程任务打包交出去,这一类活儿 Astra 遥遥领先。

    AI News 的基准面板展示 Terminal-Bench 4.0 分组柱状图,提示框标出 Astra 57.9、Fable 5.1 55.8、Gemini 3.8 Flash 19.1。
    AI News 图表里的 Terminal-Bench 4.0:Astra 57.9,Fable 5.1 55.8,Gemini 3.8 Flash 19.1。视频 7:32 处
  2. 6

    科学推理:GPQA Diamond 几乎打平

    研究生级别的科学推理就咬得很紧了。同一张图里 GPQA Diamond 是 Astra 96%——和 OpenAI 官方公布的一致——Gemini 3.8 Flash 95.3%,Fable 5.1 93.7%。差距不到一个百分点,说明拼问答质量很难分出胜负,真正该比的是价格和速度。

    同一张三方柱状图这次打开了 GPQA Diamond 的提示框,列出 Astra 96、Fable 5.1 93.7、Gemini 3.8 Flash 95.3。
    GPQA Diamond 几乎不分胜负:AI News 图表上 96 对 95.3。视频 7:36 处
  3. 7

    多模态竞技场:同一提示词,三个模型

    第三方竞技场已经开始让三家旗舰同台。each-labs 的这组对比把同一个罗马竞技场提示词分别喂给 Fable 5.1、GPT-6 Astra 和 Gemini 3.8 Flash,画面一致性和细节自己看——顶部横幅也点出了关键:Astra 这一档的输出要 $50 每百万 token。两边的多模态能力都是真的,差的是账单。

    each-labs 的竞技场画面把 Fable 5.1、GPT-6 Astra 和 Gemini 3.8 Flash 排成三列,渲染同一个竞技场提示词,上方挂着 $50 每百万输出的横幅。
    同一提示词喂三个模型:第三方竞技场让差距肉眼可见。视频 2:56 处
  4. 8

    电脑操作:Astra 亲自逛超市下单

    电脑操作是 Astra 的招牌:它能直接操纵真实浏览器,这条发布演示里它正在 Macy's 超市网站上买菜下单。OpenAI 公布它在 OSWorld 2.0 上拿 72.6%,平均约 40 分钟完成一项任务,而上一代模型要 75 分钟左右;AI News 的拆解则给出 Gemini 3.8 同一测试 70.2% 的成绩。纸面差距不大,但 OpenAI 演示里真正跑完整条链路的是 Astra。

    OpenAI 的电脑操作演示里,Macy's 超市网站弹出热门搜索下拉框,GPT-6 Astra 正在真实浏览器里挑选食材。
    Astra 操作 Macy's 超市下单,正是它电脑操作得分的演示来源。视频 2:10 处

价格、上下文窗口与限额

  1. 9

    Astra 价格:每百万 $10 和 $50,还要算上力度

    Astra 的标价是每百万输入 token $10、输出 $50,约是 Gemini 3.8 Flash 首发价 $0.75 和 $3.75 的 13 倍。它还有一档力度旋钮:编程界面会提醒你,力度越高,用量限额烧得越快;OpenAI 另有快两倍也贵两倍的 fast mode。算成本时,力度和 token 都要算进去。

    一个编程对话工具把 Select effort 滑杆推到最大,下方提示力度越高,用量限额消耗得越快。
    力度设置直接影响账单:界面明说限额会烧得更快。视频 0:32 处
  2. 10

    Gemini 3.8 Flash:首发价和精确限额

    Gemini 3.8 Flash 的参数表很直白:1,048,576 输入 token、65,536 输出 token,思考力度分低、中、高三档。API 首发价是每百万输入 $0.75、输出 $3.75,Google 价格页写明 2027 年 1 月 1 日起翻倍到 $1.50 和 $7.50。Astra 那边大约 1M 输入、128K 输出,上下文这一局打平,价格那一局则完全没得打。

    NasBuilds 给 Gemini 3.8 Flash 做的参数卡写着 1M 上下文、64K 输出,下方 LOW、MEDIUM、HIGH 三档里 HIGH 高亮。
    Gemini 3.8 Flash 的自家数字:1M 上下文,64K 输出,三档思考力度。视频 6:03 处
  3. 11

    在 Antigravity 里选力度:High、Medium 还是 Low

    在 Google 的 Antigravity IDE 里,这笔账摆在明面上:Gemini 3.8 Flash 分 High、Medium、Low Fast 三档,往下还能一键切到 Claude 系模型。NasBuilds 的拆解提醒过,推理力度越高烧的 token 越多,实际花销取决于你让模型多用力。日常活儿用 Medium,真正难啃的 bug 再上 High。

    Antigravity IDE 的模型下拉框展开,选中的是 Gemini 3.8 Flash High Fast,下方还列着 Gemini 3.7 Flash、Gemini 3.1 Pro 和两个 Claude 模型。
    Antigravity 的选择器把每一档 Gemini 的速度与质量取舍摆上台面。视频 3:30 处

各自的优势战场

  1. 12

    Astra 的主场:长链条专业电脑操作

    Astra 拉开差距的地方在深度专业工作:发布演示里它无人监督地开着 KiCad,把一张电路图一路带到可投产的 PCB 布线。这背后正是它 OSWorld 2.0 72.6% 的电脑操作能力,BenchCAD 95.9% 的成绩则说明 CAD 上同样精准。如果你的活儿要在专业工具里连跑几个小时,溢价买的就是这个。

    OpenAI 的发布演示里,KiCad 左侧是布好线的 PCB 原理图,右侧是渲染成 3D 的绿色成品电路板。
    原理图进,可投产 PCB 出:这就是 Astra 的溢价换来的活儿。视频 1:44 处
  2. 13

    Gemini 的主场:IDE 里的日常编程

    Gemini 3.8 Flash 就长在开发者已有的工具里——这条演示里它在 VS Code 里改 C++,编辑器上挂着自家徽标。NasBuilds 的实测强调它能长链条干活:规划、写码、测试、调试一口气跑完。对于目标明确的小任务,Flash 用 Flash 的价钱给出接近旗舰的结果。

    NasBuilds 的编程演示里,VS Code 正在改一段 C++ 游戏循环,编辑器标签区钉着 Gemini 3.8 Flash 徽标。
    Gemini 3.8 Flash 在 VS Code 里写代码——大多数日常工程就发生在这里。视频 5:50 处
  3. 14

    Gemini 的主场:一个提示词快速做出小游戏

    在 Antigravity 里给它一个 Geometry Dash 风格的需求,Gemini 3.8 Flash 做出了一款能玩的游戏:九个有名字的关卡、练习模式、还有一个能用的关卡编辑器——Viral Echoes 的作者自己都说超出预期。这是一次会话里真实跑起来的代码,不是摆拍的演示。拼快速创意原型,Flash 确实难被打败。

    做好的 Geometry Dash 风格游戏展示关卡选择网格,九个关卡各有名字,比如 Crystal Prism 和 Solar Apex,每关都有开始和练习按钮。
    一次会话做出九关街机小游戏,还带编辑器和练习模式。视频 4:06 处
  4. 15

    提示词像项目,就交给 Astra

    Astra 的主场是大需求:开发者把整份规格说明贴进 Codex,调好力度,让它从头跑到尾——这条赛车游戏需求单写了几百行才开始第一次构建。这也正对 OpenAI 给 Astra 的定位:电脑操作、长流程和科研。如果你的提示词长这样,溢价花得值;如果只是一段话的小请求,Flash 才是理性默认。

    Codex 里滚动展示一份几百行的赛车游戏项目需求单,提示词旁边钉着一张参考图。
    项目级的提示词,才是 GPT-6 Astra 溢价的用武之地。视频 0:26 处

到底该选哪一个?

  1. 16

    一句话权衡:能力对价格

    第三方对比的结论越来越一致:同一件事,两种钱包。Artificial Analysis 的智能指数里 Astra 拿 53 分,Gemini 3.8 Flash 拿 41 分;但每道题的实测成本是 $3.26 对 $1.24。任务长、难、返工贵,选 Astra;任务短、频、拼速度,选 Flash。

    一张第三方对比卡片以“Which would you pick”为题,下方并排 Fable 5.1 和 GPT-6 Astra 的产品照片,配文“Same photos. Same tasks”。
    同样的照片,同样的任务,不同的价格——一张图讲完整个决策。视频 1:53 处

常见问题

继续探索