Claude Sonnet 5.5 对比 Gemini 3.8 Flash:你到底该用哪个?

2026 年 9 月,预算党迎来了两款定位完全不同的中档模型。Google 的 Gemini 3.8 Flash(9 月 2 日)是六周里的第三次 Flash 更新——够快、够便宜,Google 声称它现在能干出高档模型的活。Anthropic 的 Claude Sonnet 5.5(9 月 28 日)延续了 Sonnet 的定价,却声称带来接近 Opus 5.5 的判断力,价格只有 Opus 的一半,据报道 Artificial Analysis 智能指数给到 56 分,比 GPT-6 Astra 还高 3 分。这篇攻略用五组真实评测素材逐步对比:价格表、基准图表、上手实录,看清楚各自的主场,再决定哪一个适合你的活。

来源与致谢

本教程的截图来自 Bijan Bowen 的公开演示视频。每个步骤都链接到视频中的对应时间点,方便你对照学习。

Bijan Bowen ↗

一分钟速览结论

  1. 1

    两场九月发布,前后差 26 天

    Google 在 9 月 2 日发布 Gemini 3.8 Flash——大约六周里的第三次 Flash 更新,公告把公式写得明明白白:保持 3.7 的速度和低价,把提升集中在编程和智能体能力上。Anthropic 在 9 月 28 日用 Claude Sonnet 5.5 应战,定位是 Opus 5.5 的更快、更便宜搭档。所以这场对决的本质是「便宜的速度」对「接近旗舰的判断力」——两边都想当你每天打开的那个默认模型。

    Google 的发布公告把 Gemini 3.8 Flash 介绍为六周内的第三次 Flash 发布,承诺保持 3.7 Flash 的速度和低价,提升集中在编程与智能体能力。
    六周三连发,Google 的性价比打法就写在公告里。视频 0:38 处
  2. 2

    先说结论:看单位质量的价格

    在 The Average Tech Dad 实录的一份长链条软件工程独立排行榜上,Gemini 3.8 Flash 和 GPT-6 Astra 同样拿到 74%——但 Gemini 的平均成本是每任务 2.36 美元,Astra 要 6.52 美元,Claude Opus 5 更是 11.84 美元。这就是 Flash 性价比故事的全部。Sonnet 5.5 给出的是另一种答案:Anthropic 称它完成同样任务所需的 token 远少于 Sonnet 5,单任务成本最多能省 30%,输出速度还快约 30%;据报道 Artificial Analysis 智能指数给它 56 分,比 GPT-6 Astra 高 3 分。价格榜上 Gemini 赢,而 Sonnet 5.5 是通往旗舰级判断力最便宜的一条路。

    独立智能体排行榜显示 Gemini 3.8 Flash 拿到 74% 成绩、单任务成本 2.36 美元,而 GPT-6 Astra 花 6.52 美元、Claude Opus 5 花 11.84 美元才拿到同样的分数。
    同样的 74%:Flash 花 2.36 美元,Astra 花 6.52 美元,Opus 5 花 11.84 美元。视频 1:00 处

价格牌与小字条款

  1. 3

    Sonnet 5.5 定价:牌价没变,任务变便宜了

    Anthropic 把 Sonnet 的定价原封不动:每百万输入 token 2 美元、输出 10 美元,缓存读取 0.20 美元、缓存写入 2.50 美元——全线正好是 Opus 5.5 的一半,Fahd Mirza 实录里的成本速度表写得清清楚楚。真正的省钱点在使用行为上:Anthropic 表示模型完成同样任务所需的 token 明显更少,因此单任务成本最多比 Sonnet 5 低 30%,输出速度也快约 30%。同一条视频里还有个提醒:输出 token 每百万 10 美元的价位,无人看管的智能体照样能烧出一笔惊人的账单——演示里那个蹦床游戏大约烧掉了 25 到 30 美元。

    Anthropic 的成本速度表列出 Claude Sonnet 5.5 每百万 token 输入 2 美元、输出 10 美元、缓存读取 0.20 美元,正好是 Claude Opus 5.5 的一半。
    Sonnet 5.5 沿用 Sonnet 5 的价签:输入 2 美元,输出 10 美元。视频 1:04 处
  2. 4

    Gemini 3.8 Flash 定价:输入 0.75 美元、输出 3.75 美元——暂时

    Google 的发布表给 Gemini 3.8 Flash 定价每百万输入 token 0.75 美元、输出 3.75 美元——这是五折 introductory 价,按 Google 自己评测表脚注的说法,2026 年 12 月 31 日到期,之后两项数字翻倍到 1.50 和 7.50 美元。即便按原价,同一张表上的每一列 Claude 都比它贵:Claude Sonnet 5 是 2 美元和 10 美元,Claude Opus 5 是 5 美元和 25 美元。表里的 DeepSWE v1.1 一行把卖点说得很直白:3.8 Flash 拿 73.7%,Claude Opus 5 拿 74.0%——长链条工程产出几乎打平,标价却差了一个量级。

    Google 的发布表对比 Gemini 3.8 Flash 每百万 token 输入 0.75 美元、输出 3.75 美元的定价,并列出 Claude Opus 5、Claude Sonnet 5 和 GPT-5.6 各档价格。
    在 Google 自己的表上,Flash 比每一列 Claude 和 GPT 都便宜。视频 1:10 处
  3. 5

    每个价位的货:上下文与能力清单

    Gemini API 里 gemini-3.8-flash 的规格卡就是一份主力机清单:输入 1,048,576 token、输出 65,536 token,输出类型只有文本——它能读文本、图片、视频、音频和 PDF,但绝不会反过来给你生成一张图或一段视频。搜索 grounding、代码执行、函数调用和 URL 上下文全部支持,computer use 处于预览状态,thinking 分低、中、高三档,默认中档。Sonnet 5.5 这边的对位是:约 262K 上下文、实打实的 computer use 实力,以及 Anthropic 现场演示的文档润色——一份 10 页财报评审幻灯片,两位评审认定不用改就能发。

    Gemini API 文档的 gemini-3.8-flash 页面列出 1,048,576 输入 token 上限、65,536 输出 token、纯文本输出以及低中高三级 thinking。
    数字都在这:输入 1,048,576 token,输出 65,536,只吐文本。视频 8:30 处

Claude Sonnet 5.5 的优势战场

  1. 6

    它真的站在 Opus 5.5 的肩膀上

    「半价接近 Opus」这句话,最硬的证据来自 Anthropic 自己的发布表:FrontierCode 1.1 上 Sonnet 5.5 在 extra-high 档拿到 52.1%,Opus 5.5 是 54.4%;CursorBench 4.0 两者是 55.5% 对 57.8%;知识工作类只差一两分——GDPval-AA 上是 1844 对 1846。Computer use 更是几乎打平:OSWorld 2.1 上 80.1% 对 81.8%,而 token 价格只有一半。这些是厂商数字,独立评测榜单在本攻略成稿时仍在陆续出炉,但趋势是一致的:日常工程里,Sonnet 5.5 干的就是 Opus 5.5 的活,账单减半。

    Anthropic 的发布表显示 Claude Sonnet 5.5 在 FrontierCode、CursorBench、OSWorld 和知识工作基准上与 Claude Opus 5.5 只差几个百分点,价格却只有一半。
    Anthropic 自己的表:Sonnet 5.5 一行一行贴着 Opus 5.5 走。视频 2:50 处
  2. 7

    省钱的玄机藏在 effort 档位里

    Fahd Mirza 的 Terminal-Bench 4.0 准确率对成本曲线,解释了 Sonnet 5.5 到底该怎么用才省钱。低档和中档时,那条蓝线就已经超过 Sonnet 5 能做到的一切——Anthropic 声称低或中档的最佳成绩能以约十分之一的单任务成本超过 Sonnet 5 的最高分。推到 extra-high 和 max 档,模型继续爬升,在 max 附近整体反超 Opus 5.5,而 Opus 已经进入平台期甚至回落。他的使用建议和曲线一致:日常住在中档,值得的任务再开高档——高档又烧钱又烧限额。

    Terminal-Bench 4.0 的准确率对成本曲线图,描绘 Claude Sonnet 5.5 随 effort 从低档升到最高档、反超 Claude Opus 5.5 的过程。
    max 档就是 Sonnet 5.5 反超 Opus 5.5 的地方。视频 3:45 处
  3. 8

    文档、幻灯片和润色:Sonnet 的看家本事

    Anthropic 给 Sonnet 5.5 的定位是干明确日常活的那条线:修 bug、表格、演示文稿、文档。它发布会上的例子——一份 10 页财报评审幻灯片,两位评审认定不用改就能发——正是它和廉价模型的分界线。发布会上引用的早期客户也在佐证这种成品感:Box 称输出更快、准确率更高、速度达 2.4 倍,Zendesk 的工单处理快了 20%,Slack 在同类写作里输出 token 少了约 14%。它还是第一个带上 Opus 级网络安全防护的 Sonnet:常规开发完全不受影响,高风险安全请求则会被拦下。

    Sonnet 5.5 的讲解图列出这款模型最擅长的几站:修 bug、文档与幻灯片、UI 打磨、computer use 和规模化客服。
    Anthropic 认定的五个 Sonnet 5.5 主场。视频 2:42 处

Gemini 3.8 Flash 的优势战场

  1. 9

    接近旗舰的分数,零头的账单

    Google 的评测表激进得不像一个廉价模型:Gemini 3.8 Flash 在 CharXiv Reasoning 上拿 86.2%,LV-Bench 智能体模式 87.8%,HLE-Verified 54.9%,BioMysteryBench 88.8%——和 Claude Opus 5 逐行互有胜负,而每百万输出 token 的价格只是零头。按 Google 自己的测试,这一版把 Terminal-Bench 从 82% 拉到 91%、DeepSWE 从 65% 拉到 74%,公司把进步归因于「更勤奋」:更多推理步骤、反复调用工具,高 effort 时尤其明显。厂商数字当然要打个问号,但 Bijan Bowen 的上手实测结论一致——明显强于 3.7,非常快,也确实便宜。

    Google 的评测表给 Gemini 3.8 Flash 打出 CharXiv Reasoning 86.2%、OSWorld-2.0 59%、BioMysteryBench 88.8%,旁边是 Claude 与 GPT-5.6 各列的对比。
    Google 的评测表:接近旗舰的分数,预算级的价格。视频 1:35 处
  2. 10

    一句提示词进去,一个能玩的 3D 世界出来

    The Average Tech Dad 在 Google 的 Antigravity IDE 里给 Gemini 3.8 Flash(High 档,Pro 订阅)下达了一个长任务,收到的成品是《The Constituency》——一款完整的 3D 政治策略游戏:每位玩家随机种子生成地图、十六回合、本币预算、满意度和被调查度两条状态条、从水井到自来水厂的建造面板,还有等距视角镜头。他说免费档用户也能玩出点名堂,只是做不出整款游戏。这就是 Flash 交换法则的缩影:判断力不如旗舰精致,但迭代够快、试错够便宜。

    由 Gemini 3.8 Flash 在 Antigravity 里打造的 3D 策略游戏《The Constituency》,画面里有预算条、建造面板、被调查度和等距地图。
    预算级 AI 版的 3D 治理策略游戏。视频 5:35 处
  3. 11

    一句话造出一整套应用——附赠合成器浪潮风

    Bijan Bowen 的浏览器操作系统测试从另一个角度展示了同一件事:给 Antigravity 一条提示词,产出了浏览器里的整套合成器浪潮风桌面——带窗口化邮件应用、代码编辑器、程序化壁纸,还有内置的 Cyber-Doom 3D 霓虹竞技场射击游戏,有波次计数和计分板。他打趣说每一代 Flash 都爱合成器浪潮——这套美学已经延续了好几代模型。给购买者的启示是:Gemini 3.8 Flash 已经快和便宜到「一句话做一个创意项目」不再是奢侈,不过粗糙之处也在——他测到一个手表商店网站,齿轮转轴都是错的。

    Gemini 3.8 Flash 打造的合成器浪潮风浏览器操作系统,正在浏览器里运行内置的 Cyber-Doom 3D 霓虹竞技场游戏,带波次计数和计分板。
    Gemini 造的浏览器操作系统——自带霓虹竞技场。视频 5:30 处

正面对决:编程、文档、成本、智能体

  1. 12

    编程:打磨和判断力 对 速度和价格

    真实编程场景最能看出两者的分野。Sonnet 5.5 像一位资深结对程序员:在 Fahd Mirza 的 Claude Code 会话里,它规划了 Blender 加 Godot 的蹦床游戏,发现任务描述自身的数字自相矛盾并当场指出,最后交出可玩的版本——代价大约 25 到 30 美元 token。Gemini 3.8 Flash 则像短跑选手:Bijan Bowen 的 C++ 滑板游戏在允许自我检查后进步明显;它还在 36 分钟内完成机械臂抓取放置任务,比同一套设备上 GPT-6 Astra 的 40 分钟更快。按「每小时人工评审能换来多少合格产出」选 Sonnet 5.5,按「每美元能换来多少次迭代」选 Gemini。

    Claude Code 终端正在运行 Claude Sonnet 5.5 会话开发一款 3D 蹦床游戏,状态栏显示 token 用量和每秒 27 token 的输出速度。
    Claude Code 里一次真实的 Sonnet 5.5 编程实跑。视频 0:40 处
  2. 13

    长文档:窗口都不小,脾气各不同

    两者的输入胃口都很大——Gemini 3.8 Flash 白纸黑字写着 1,048,576 输入 token,BitBiasedAI 的测试把两小时会议的完整记录一次性贴进去,要求列出每个任务、负责人和截止时间,模型在第 10 分钟和第 90 分钟的细节之间没有丢线。多模态阅读是真优势:丢给它一张广告数据面板截图,它会像本帧这样逐项诊断,点名 CTR、转化数和单次转化成本并给出原因。Sonnet 5.5 也读得了长上下文(标准设置约 262K),但它的价值在输出端——不是替你总结文档,而是把文档和幻灯片打磨到能发出去。

    Gemini 3.8 Flash 读取上传的广告数据面板截图,列出 CTR、转化数和单次转化成本为落后指标,并给出可能原因。
    贴一张数据面板截图,换回一份逐指标诊断。视频 9:05 处
  3. 14

    速度与成本:Flash 赢牌价,Sonnet 赢单位判断力

    开头那份独立排行榜把成本差距钉死了:同样的 74% 质量,Gemini 3.8 Flash 花 2.36 美元,GPT-5.6 Sol 花 6.46 美元,GPT-6 Astra 花 6.52 美元,Claude Opus 5 花 11.84 美元。Gemini 还是生猛的快——多位评测者形容 Flash 的输出速度「像机关枪」。Sonnet 5.5 在价格榜上永远赢不了,但 Anthropic 的效率主张——单任务最多比 Sonnet 5 便宜 30%、快约 30%、低中档以约十分之一成本超过 Sonnet 5 的最高分——换了一个比较维度:你买的不是更少的美元,而是更少的返工。

    智能体基准计分板上,Gemini 3.8 Flash 以平均 2.36 美元排在 GPT-5.6 Sol 的 6.46 美元、GPT-6 Astra 的 6.52 美元和 Claude Opus 5 的 11.84 美元旁边,分数同为约 74%。
    同等质量下,各家旗舰分别要花多少钱。视频 1:30 处
  4. 15

    智能体:Gemini 的视觉绝活 对 Sonnet 的护栏

    自主任务上,两家玩的是两种运动。Gemini 3.8 Flash 用一个故意很糟的摄像头角度,在 36 分钟内指挥实体机械臂完成抓取放置,自己写视觉管线和任务脚本——Google 也把智能体工具链当成一等公民,computer use 预览中、搜索 grounding 原生内置。Sonnet 5.5 的回应是可靠性基建:Opus 级安全护栏、接近 Opus 的 computer use 分数(OSWorld 2.1 拿 80.1%)、上线即通过 AWS 并据报道支持 GitHub Copilot,再加上让长循环不超支的 token 纪律。按失败模式选:吃感知的任务给 Gemini,无人值守的长循环给 Sonnet。

    蓝色机械臂正夹起一辆橙色玩具车,背后显示器上是 Gemini 3.8 Flash 的 Antigravity 会话,正在写视觉管线和抓取放置脚本。
    36 分钟,一条机械臂,全程没人搭手。视频 16:20 处

到底该选哪一个?

  1. 16

    按角色选,别按信仰选

    把选择翻译成具体工种,答案就简单了。日常工程、修 bug、客户交付物、文档幻灯片、computer use 流程,以及任何「答错了很贵」的无人值守循环——选 Claude Sonnet 5.5,它是离 Opus 5.5 判断力最近的中档模型,价格只有一半。高频任务、快速草稿、需要联网检索的回答、截图和 PDF 的多模态阅读,以及每次迭代只花几美分的一句话创意构建——选 Gemini 3.8 Flash。至于 Gemini 4 的传言,现在请忽略:Gemini 4 并未发布,只有爆料,3.8 Flash 才是 Google 当前的中档型号,也是本页公平的对比对象。很多团队会两个都用,按任务路由。

    模型选择讲解图把任务分成两类:Sonnet 5.5 负责清晰、边界明确的工作,Opus 5.5 负责复杂开放、出错代价高的任务。
    两条线两种活:按任务路由,别站队。视频 4:02 处

常见问题

继续探索