查看: 3|回复: 0

Theo 给当前主流 15 个 AI 模型排名

[复制链接]

7

主题

0

回帖

21

积分

新手上路

积分
21
发表于 昨天 23:35 | 显示全部楼层 |阅读模式
Theo 给当前主流 15 个 AI 模型排名

@theo
是 T3 Code 作者、知名 AI 博主,他的排名一共六档 S -> F,Claude Fable 5 独占 S 档、Gemini 全落在 F 档、F 档还有一个意外?!
https://youtube.com/watch?v=06BvFMW8Ng8

Theo 的评价框架:排名背后的四个核心维度
1. Token 效率(而非单价):每百万 token 的标价没有意义,真正重要的是"完成一个任务总共花多少 token"。他多次强调:单价便宜但 token 消耗巨大的模型,实际成本反而更高。
2. 真实任务成本:以"每个任务实际花多少美元"为锚(引用 Cursor Bench、Artificial Analysis 数据)。
3. 视觉能力:他日常大量粘贴截图,2026 年不支持图像输入的模型在他这里会被直接重罚。
4. 工作流契合度:模型能否脱离"人肉监督"独立交付——这是他心中 S 级与其余一切的分水岭。

最终梯队总览
S - Claude Fable 5(Anthropic)
  唯一的 S 级;他心中"有史以来最好的模型"
A - GPT-5.6 Sol(OpenAI,A 级之首,接近 S)、5.6 Luna、DeepSeek V4 Flash
  Sol 是他的日常默认模型;后两者是超高性价比的"杂务之王"
B - Kimi K3(月之暗面,B 级之首)
  首个能端到端完成复杂任务的开源权重模型
C - GPT-5.6 Terra
  定价卡在尴尬中间位,找不到使用场景
D - GLM 5.3、Composer 2.5、Grok 4.6、Muse Spark、  Opus 5、Sonnet 5
  各有亮点,但实战中没有选择它们的理由
F - Gemini 3.7 Flash、Gemini 3.1 Pro、DeepSeek V4 Pro
  定价/效率失衡,或旗舰模型缺失视觉能力



本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

关注公众号

相关侵权、举报、投诉及建议等,请发 E-mail:2776601884@qq.com

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.|青ICP备2025004122号-1

在本版发帖
关注公众号
返回顶部