✅ Terminal-Bench 4.0:66.4%(GPT-6 Astra 57.9%,GPT-5.6 Sol 只有 37.3%)
✅ FrontierCode v1.1:54.4%,全场第一
✅ CursorBench 4.0:57.8%,领先第二名 6 个点
✅ GDPval-AA 知识工作:1846 分,断层领先
✅ OSWorld 2.0 电脑操作:81.8%
✅ 图表识别:89.0%
Agentic coding 三项全第一,代码能力这块 Anthropic 是真没对手了。
唯一丢的两项:业务流程自动化(AutomationBench)和科研(TB-Science)被 GPT-6 Astra 拿下。
我的判断:写代码、做知识工作选 Opus 5.5,做自动化流程的可以再看看 Astra。