@theo
是 T3 Code 作者、知名 AI 博主,他的排名一共六档 S -> F,Claude Fable 5 独占 S 档、Gemini 全落在 F 档、F 档还有一个意外?!
https://youtube.com/watch?v=06BvFMW8Ng8
Theo 的评价框架:排名背后的四个核心维度
1. Token 效率(而非单价):每百万 token 的标价没有意义,真正重要的是"完成一个任务总共花多少 token"。他多次强调:单价便宜但 token 消耗巨大的模型,实际成本反而更高。
2. 真实任务成本:以"每个任务实际花多少美元"为锚(引用 Cursor Bench、Artificial Analysis 数据)。
3. 视觉能力:他日常大量粘贴截图,2026 年不支持图像输入的模型在他这里会被直接重罚。
4. 工作流契合度:模型能否脱离"人肉监督"独立交付——这是他心中 S 级与其余一切的分水岭。
最终梯队总览
S - Claude Fable 5(Anthropic)
唯一的 S 级;他心中"有史以来最好的模型"
A - GPT-5.6 Sol(OpenAI,A 级之首,接近 S)、5.6 Luna、DeepSeek V4 Flash
Sol 是他的日常默认模型;后两者是超高性价比的"杂务之王"
B - Kimi K3(月之暗面,B 级之首)
首个能端到端完成复杂任务的开源权重模型
C - GPT-5.6 Terra
定价卡在尴尬中间位,找不到使用场景
D - GLM 5.3、Composer 2.5、Grok 4.6、Muse Spark、 Opus 5、Sonnet 5
各有亮点,但实战中没有选择它们的理由
F - Gemini 3.7 Flash、Gemini 3.1 Pro、DeepSeek V4 Pro
定价/效率失衡,或旗舰模型缺失视觉能力