10:03
同一句提示词横测 5 个模型:Opus 5.5 五分钟做完 3D 鹈鹕骑车,GPT 两个版本的车都在倒着骑
点赞、投币、收藏和评论只能在 B 站上完成。
视频简介
9 月 22 日 Claude Opus 5.5 上线:比 Opus 5 便宜 40%,编码跑分压过贵 2.5 倍的 Fable 5.1,当天就成了 Claude Code 的默认模型。
视频前半段讲它和 Opus 5 的区别(价格、默认 effort、思考模式、跑分),后半段用同一句提示词「生成一个鹈鹕骑自行车的 3D 页面」横测 5 个前沿模型:
▶ Claude Opus 5.5:5 分 41 秒,最快,效果最好,产物只有一个 index.html ▶ GPT-5.6 Sol:13 分钟,自行车倒着骑 ▶ GPT-6 Sol:14 分钟,同样倒着骑 ▶ GPT-6 Astra:24 分 22 秒,方向对了,效果还行 ▶ Claude Opus 5:跑了 40 多分钟还没写完,中途停掉 (其他次复跑需要二十几分钟)
速度排名:Opus 5.5 > GPT-5.6 Sol > GPT-6 Sol > GPT-6 Astra > Opus 5
几点说明: · Opus 5.5 用的是默认 medium 强度,三个 GPT 模型开的是 xhigh · 同一句提示词每次跑的结果都不一样,这只是一次测试的结果,看个大概 · 「鹈鹕骑自行车」已经被测得太多,厂商可能针对性训练过,真想比模型好坏,得用网上找不到现成答案的题目 · 这个需求一个 html 就能搞定,GPT 这几个模型普遍生成了一整个项目,把简单问题复杂化了
演示工具:智码 AICoder(多厂商、多会话并排开,同一个窗口里切 Claude Code 和 Codex)
00:00 Opus 5.5 上线的两处反常 01:36 价格:单价降 20%,缓存读降 60% 02:12 六项跑分与全家族对比 02:36 同一天发布的 GPT-6 Sol 03:00 结论:日常主力换 Opus 5.5 03:12 实测开始:同一句提示词开 5 个会话 05:20 Opus 5.5 成品(5 分 41 秒) 05:50 GPT-5.6 Sol:车倒着骑 06:10 GPT-6 Sol:同样倒着骑 06:50 GPT-6 Astra(24 分 22 秒) 07:30 Opus 5(40 分钟未完成) 08:50 速度排名,以及为什么不能总用同一句提示词测 09:50 产物对比:一个 html vs 一整个项目
所用软件: 智码 AiCoder https://aicoder.ruoyi.plus/


