跳到正文
抓蛙师视频库

同一句提示词横测 5 个模型:Opus 5.5 五分钟做完 3D 鹈鹕骑车,GPT 两个版本的车都在倒着骑

发布于 时长 10:28 964 次播放 (截至 2026-09-27)

点赞、投币、收藏和评论只能在 B 站上完成。

视频简介

9 月 22 日 Claude Opus 5.5 上线:比 Opus 5 便宜 40%,编码跑分压过贵 2.5 倍的 Fable 5.1,当天就成了 Claude Code 的默认模型。

视频前半段讲它和 Opus 5 的区别(价格、默认 effort、思考模式、跑分),后半段用同一句提示词「生成一个鹈鹕骑自行车的 3D 页面」横测 5 个前沿模型:

▶ Claude Opus 5.5:5 分 41 秒,最快,效果最好,产物只有一个 index.html ▶ GPT-5.6 Sol:13 分钟,自行车倒着骑 ▶ GPT-6 Sol:14 分钟,同样倒着骑 ▶ GPT-6 Astra:24 分 22 秒,方向对了,效果还行 ▶ Claude Opus 5:跑了 40 多分钟还没写完,中途停掉 (其他次复跑需要二十几分钟)

速度排名:Opus 5.5 > GPT-5.6 Sol > GPT-6 Sol > GPT-6 Astra > Opus 5

几点说明: · Opus 5.5 用的是默认 medium 强度,三个 GPT 模型开的是 xhigh · 同一句提示词每次跑的结果都不一样,这只是一次测试的结果,看个大概 · 「鹈鹕骑自行车」已经被测得太多,厂商可能针对性训练过,真想比模型好坏,得用网上找不到现成答案的题目 · 这个需求一个 html 就能搞定,GPT 这几个模型普遍生成了一整个项目,把简单问题复杂化了

演示工具:智码 AICoder(多厂商、多会话并排开,同一个窗口里切 Claude Code 和 Codex)

00:00 Opus 5.5 上线的两处反常 01:36 价格:单价降 20%,缓存读降 60% 02:12 六项跑分与全家族对比 02:36 同一天发布的 GPT-6 Sol 03:00 结论:日常主力换 Opus 5.5 03:12 实测开始:同一句提示词开 5 个会话 05:20 Opus 5.5 成品(5 分 41 秒) 05:50 GPT-5.6 Sol:车倒着骑 06:10 GPT-6 Sol:同样倒着骑 06:50 GPT-6 Astra(24 分 22 秒) 07:30 Opus 5(40 分钟未完成) 08:50 速度排名,以及为什么不能总用同一句提示词测 09:50 产物对比:一个 html vs 一整个项目

所用软件: 智码 AiCoder https://aicoder.ruoyi.plus/