查看: 1|回复: 0

不儿? GLM-5.3的测试分数是怎么翻6倍的?

[复制链接]

8

主题

1

回帖

36

积分

新手上路

积分
36
发表于 2 小时前 | 显示全部楼层 |阅读模式
不儿? GLM-5.3的测试分数是怎么翻6倍的?

有一说一这个分数飞升有点猛了, 按我对 Terminal Bench 3.0 的理解, 里面的任务是实打实的难的.

比如这个 exam-pdf-eval, 就是个给考试试卷(PDF格式)评分的任务, 模型并不是自己直接解析PDF然后阅卷评分的, 而是要调用一个VLM, 然后自己写prompt, 让 VLM 抽取试卷内容, 然后再评分.

这是个最近特别火的概念, 叫【clarify model-specific prompt formatting】澄清特定模型的提示词格式, 也就是说, 模型要构建一个基于第三方黑盒的闭环验证系统. 这个VLM就是最大的变数.

以往来看, Terminal Bench 3.0 中的问题 Anthropic 系列的模型能打高分, 是因为有部分题目就是他们的研究员出的. 基本是御用测试题了.

但这次的跑分图,GLM-5.3 直接翻了六倍!所以估计 GLM-5.3 这次在复杂真实环境下做架构规划的能力会非常强.

尤其是面对黑盒 API, 不可预知的命令行报错和自己写 Prompt 的套娃任务,都会有不错的表现.

稍后我会给大家带来实测!

(感觉自己活脱就是个渣男, 每个模型都想测, 但是肝不过来...已经虚了.....)




#HOW I AI#


本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

关注公众号

相关侵权、举报、投诉及建议等,请发 E-mail:2776601884@qq.com

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.|青ICP备2025004122号-1

在本版发帖
关注公众号
返回顶部