<?xml version="1.0" encoding="utf-8"?>
<rss version="2.0">
  <channel>
    <title>一起港湾 - AI 评测与前沿</title>
    <link>https://www.17gw.com/forum-66-1.html</link>
    <description>Latest 20 threads of AI 评测与前沿</description>
    <copyright>Copyright(C) 一起港湾</copyright>
    <generator>Discuz! Board by Discuz! Team</generator>
    <lastBuildDate>Thu, 08 Oct 2026 22:55:31 +0000</lastBuildDate>
    <ttl>60</ttl>
    <image>
      <url>https://www.17gw.com/static/image/common/logo_88_31.gif</url>
      <title>一起港湾</title>
      <link>https://www.17gw.com/</link>
    </image>
    <item>
      <title>🔥分类赛道变天了！OpenRouter 最新一周数据：Jev 拿下分类请求 27% 份额，几乎是DeepSeek V4 Flash的 2 倍！</title>
      <link>https://www.17gw.com/thread-8859-1-1.html</link>
      <description><![CDATA[🔥分类赛道变天了！OpenRouter 最新一周数据：Jev 拿下分类请求 27% 份额，几乎是DeepSeek V4 Flash的 2 倍！

当前分类请求前 3：
1️⃣TypeSafe Jev 1.13 — 27%（从接近 0 拉到第一）
2️⃣DeepSeek V4 Flash — 约 14%（此前长期第一）
3️⃣Google Gemma 4 26B A4B ...]]></description>
      <category>AI 评测与前沿</category>
      <author>透明的黑色</author>
      <pubDate>Sun, 27 Sep 2026 11:58:41 +0000</pubDate>
    </item>
    <item>
      <title>基于 FrontierHarness 和 @LotusDecoder 的工作，我们新增了针对 GLM-5.3 和 GLM-5.3-Flash 的 ZCode 支持。</title>
      <link>https://www.17gw.com/thread-8549-1-1.html</link>
      <description><![CDATA[基于 FrontierHarness 和 @LotusDecoder 的工作，我们新增了针对 GLM-5.3 和 GLM-5.3-Flash 的 ZCode 支持。

ZCode 是目前针对 GLM-5.3 最强大的评测框架，且成本低于排名第二的“Claude Code + GLM-5.3”组合。

由于任务集规模较小，我们对每种组合进行了三次运行以 ...]]></description>
      <category>AI 评测与前沿</category>
      <author>远远落后</author>
      <pubDate>Mon, 14 Sep 2026 14:25:14 +0000</pubDate>
    </item>
    <item>
      <title>我针对实际任务测试了 DeepSeek V4.1 Flash。测试涉及 2 个代码库和 105 个隐藏 Bug，要求模型尽可能找出并修复这些问题。</title>
      <link>https://www.17gw.com/thread-8489-1-1.html</link>
      <description><![CDATA[我针对实际任务测试了 DeepSeek V4.1 Flash。测试涉及 2 个代码库和 105 个隐藏 Bug，要求模型尽可能找出并修复这些问题。

Opus 5 (max): 27
Grok 4.6 (max): 27
DeepSeek V4.1 Flash (max): 24
GPT-5.6 Luna (xhigh): 23
Opus 5 (high): 21

对于日常任务而言，这确实 ...]]></description>
      <category>AI 评测与前沿</category>
      <author>chenyumai</author>
      <pubDate>Thu, 10 Sep 2026 13:42:52 +0000</pubDate>
    </item>
    <item>
      <title>全球最强模型Fable5.1发布#Anthropic这次更新Claude Fable 5.1与Mythos 5.1，把重心放在编程和科学能力上，这点我还挺看好。</title>
      <link>https://www.17gw.com/thread-8164-1-1.html</link>
      <description><![CDATA[#全球最强模型Fable5.1发布#Anthropic这次更新Claude Fable 5.1与Mythos 5.1，把重心放在编程和科学能力上，这点我还挺看好。


不少基准测试数据，已经跑赢前代还有GPT‑5.6 Sol，纸面提升很突出。

再加上缓存费用直接下调75%，还配套企业安全方案，开发者的使用门槛 ...]]></description>
      <category>AI 评测与前沿</category>
      <author>diyaxu88</author>
      <pubDate>Thu, 03 Sep 2026 04:56:35 +0000</pubDate>
    </item>
    <item>
      <title>Anthropic深夜发布：Claude Fable 5.1、Claude Mythos 5.1，性能全面碾压前代</title>
      <link>https://www.17gw.com/thread-8157-1-1.html</link>
      <description><![CDATA[Anthropic深夜发布：Claude Fable 5.1、Claude Mythos 5.1，性能全面碾压前代


科研智能体能力52.6%对Fable 5的24.7%，提升超过 110%，远超Opus 5的29.0%、GPT-5.6 Sol的22.4%

商业自动化31.4%vs17.1%提升近一倍，在复杂多步骤工作流中性能较强

这版引入了多档effort ...]]></description>
      <category>AI 评测与前沿</category>
      <author>短腿小矮基</author>
      <pubDate>Thu, 03 Sep 2026 03:52:33 +0000</pubDate>
    </item>
    <item>
      <title>Harness 的评测榜单 FrontierHarness v1.0</title>
      <link>https://www.17gw.com/thread-8141-1-1.html</link>
      <description><![CDATA[Harness 的评测榜单 FrontierHarness v1.0 


测试 harness 包括：Pi、Exo、Claude Code、Codex、DeepSeek Harness（4款）、Hermes、OpenCode、Oh My Pi、Kimi Code

测试模型：Kimi K3（选择K3，而不是 GPT、Claude，是因为测试者不想偏向 Codex 和 Claude Code)

任务 ...]]></description>
      <category>AI 评测与前沿</category>
      <author>老脸往哪儿哥</author>
      <pubDate>Thu, 03 Sep 2026 01:54:13 +0000</pubDate>
    </item>
    <item>
      <title>Google 发了 Gemini 3.8 Flash，跑分表上 14 项拿了 8 个第一，编程和 Agent 能力大幅提升，价格只有 Opus 5 的 15%。看起来很猛，但我觉得最值得聊的，恰恰是它&quot;没赢&quot;的那几项。</title>
      <link>https://www.17gw.com/thread-8133-1-1.html</link>
      <description><![CDATA[Google 发了 Gemini 3.8 Flash，跑分表上 14 项拿了 8 个第一，编程和 Agent 能力大幅提升，价格只有 Opus 5 的 15%。看起来很猛，但我觉得最值得聊的，恰恰是它\&quot;没赢\&quot;的那几项。


Terminal-bench 4.0 只有 19.1%，Opus 5 是 51.8%，差了两倍多。OSWorld-2.0 也被 Opus ...]]></description>
      <category>AI 评测与前沿</category>
      <author>有点俗</author>
      <pubDate>Thu, 03 Sep 2026 00:27:40 +0000</pubDate>
    </item>
    <item>
      <title>AI 的演进：从规则执行到自主行动</title>
      <link>https://www.17gw.com/thread-8099-1-1.html</link>
      <description><![CDATA[AI 的演进：从规则执行到自主行动

人工智能的发展，不是简单的技术替代，而是机器处理信息的方式不断变化：

从人类编写规则，到机器从数据中学习，再到模型理解目标并自主完成任务。

1. 萌芽探索期：1950s—1960s

这一阶段，人们开始追问：

机器能像人一样思考吗？ ...]]></description>
      <category>AI 评测与前沿</category>
      <author>成鸿</author>
      <pubDate>Wed, 02 Sep 2026 10:11:52 +0000</pubDate>
    </item>
    <item>
      <title>🚨对比测评：神秘模型 Ox Alpha 性能封神！</title>
      <link>https://www.17gw.com/thread-7455-1-1.html</link>
      <description><![CDATA[🚨对比测评：神秘模型 Ox Alpha 性能封神！

OpenCode 刚放出的 stealth 模型 Ox Alpha，在 DeepSWE 10 个硬核任务实测中直接碾压一众一线模型，平均分高达 80%，把大家都整不会了。

关键要点拆解：
🔹实测成绩（10 任务均值） • Ox Alpha：80%（8 个任务全过 ✓， ...]]></description>
      <category>AI 评测与前沿</category>
      <author>王允林</author>
      <pubDate>Fri, 21 Aug 2026 08:33:35 +0000</pubDate>
    </item>
    <item>
      <title>Grok 4.6 刚刚在 MedAgentBench 上排名第一......这是现实世界代理医疗保健任务最有趣的基准之一</title>
      <link>https://www.17gw.com/thread-7382-1-1.html</link>
      <description><![CDATA[Grok 4.6 刚刚在 MedAgentBench 上排名第一......这是现实世界代理医疗保健任务最有趣的基准之一

现在，Grok 有两代人跻身前三名

• #1 Grok 4.6 — ~95.9%
• #2 GPT-5.6 Sol — ~94.7%
• #3 Grok 4.5 — ~93.4%

MedAgentBench 远远超出了回答医疗问题的范围

它在 ...]]></description>
      <category>AI 评测与前沿</category>
      <author>皮埃尔</author>
      <pubDate>Thu, 20 Aug 2026 06:49:57 +0000</pubDate>
    </item>
    <item>
      <title>DeepSeek V4 Pro 正式版测评来了，SuperCLUE 综合总榜第2。</title>
      <link>https://www.17gw.com/thread-7367-1-1.html</link>
      <description><![CDATA[DeepSeek V4 Pro 正式版测评来了，SuperCLUE 综合总榜第2。

对比预览版，几个关键数字变化挺大：智能体编程 47.37→63.16（+15.85），幻觉控制 79.70→89.73，任务规划也涨了6.48分。推理耗时同步优化了，不是纯堆分。

精确指令遵循小幅下滑，开发团队明显优先强化长 ...]]></description>
      <category>AI 评测与前沿</category>
      <author>木朵</author>
      <pubDate>Thu, 20 Aug 2026 01:18:36 +0000</pubDate>
    </item>
    <item>
      <title>24 人团队，撬动 AI 芯片格局，Taalas 被 AMD 收购背后，是算力战场的转向。</title>
      <link>https://www.17gw.com/thread-7351-1-1.html</link>
      <description><![CDATA[24 人团队，撬动 AI 芯片格局，Taalas 被 AMD 收购背后，是算力战场的转向。

不同于英伟达通用 GPU 路线，Taalas 选择牺牲通用性，将模型直接固化进硬件，绕开 HBM 内存墙，实现超低延迟推理，但缺点也很明显：一块芯片只能跑一套模型，灵活性大打折扣。
AMD 这次收购 ...]]></description>
      <category>AI 评测与前沿</category>
      <author>王吉杨</author>
      <pubDate>Thu, 20 Aug 2026 00:26:32 +0000</pubDate>
    </item>
    <item>
      <title>LLM-as-a-Verifier 不断突破性价比的极限！</title>
      <link>https://www.17gw.com/thread-7315-1-1.html</link>
      <description><![CDATA[LLM-as-a-Verifier 不断突破性价比的极限！

在 Terminal-Bench 2.1 测试中，它将 DeepSeek V4 Flash 的准确率从 79% 提升至 88%，而价格却比竞争对手低 4 到 11 倍！

点击此处体验：https://github.com/llm-as-a-verifier/llm-as-a-verifier

@jackyk02
 ...]]></description>
      <category>AI 评测与前沿</category>
      <author>我爱榛子</author>
      <pubDate>Wed, 19 Aug 2026 13:46:55 +0000</pubDate>
    </item>
    <item>
      <title>阿里巴巴刚刚发布了它所缺少的那一块拼图  它叫 OpenSandbox。</title>
      <link>https://www.17gw.com/thread-7233-1-1.html</link>
      <description><![CDATA[🚨中国人又干了一票！!

阿里巴巴刚刚发布了它所缺少的那一块拼图

它叫 OpenSandbox。

真正的隔离环境，让你的代理随心所欲。

里面可以运行什么：

→ Claude Code、Codex CLI、Gemini CLI、Qwen Code 和 Kimi CLI
→ Chrome 和 Playwright 用于自动化浏览
→ 通过 V ...]]></description>
      <category>AI 评测与前沿</category>
      <author>音乐人闭能文</author>
      <pubDate>Mon, 17 Aug 2026 06:48:30 +0000</pubDate>
    </item>
    <item>
      <title>三星开始让AI造芯片了：一个月的工作压缩到两天，Exynos研发迎来新变量</title>
      <link>https://www.17gw.com/thread-7223-1-1.html</link>
      <description><![CDATA[三星开始让AI造芯片了：一个月的工作压缩到两天，Exynos研发迎来新变量

如果一个原本需要一个多月才能完成的芯片研发任务，现在两天就能搞定，会发生什么？

三星正在给出一个很有意思的答案。

根据韩国媒体最新报道，三星电子 System LSI 事业部从今年 5 月开始正式 ...]]></description>
      <category>AI 评测与前沿</category>
      <author>爱深求</author>
      <pubDate>Mon, 17 Aug 2026 00:34:54 +0000</pubDate>
    </item>
    <item>
      <title>#DeepSeekHarness发布# 【DeepSeek Harness 真正狠的地方，是它没有&quot;核心&quot;】</title>
      <link>https://www.17gw.com/thread-7200-1-1.html</link>
      <description><![CDATA[#DeepSeekHarness发布# 【DeepSeek Harness 真正狠的地方，是它没有\&quot;核心\&quot;】

DeepSeek 的 agent 框架 Harness 上线三天，39,735 个 star。多数人当它是又一个 Coding 工具，但架构文档开头就写了它的定位：no privileged core，没有特权核心。

Claude Code、Codex 的 ...]]></description>
      <category>AI 评测与前沿</category>
      <author>想拒绝呼吸</author>
      <pubDate>Sun, 16 Aug 2026 04:33:46 +0000</pubDate>
    </item>
    <item>
      <title>黄仁勋9大预言！3年后机器人满街跑，AI将重塑世界。</title>
      <link>https://www.17gw.com/thread-6892-1-1.html</link>
      <description><![CDATA[黄仁勋9大预言！3年后机器人满街跑，AI将重塑世界。

他是黄仁勋，英伟达“皮衣刀客”，手握全球AI算力命脉。2026年最新9大预言，每一条都将改变未来！

1、生成式AI只是开胃菜，智能体AI才是主菜，3年内爆发

2、3–5年机器人无处不在，走进家庭工厂

3、物理AI催生50 ...]]></description>
      <category>AI 评测与前沿</category>
      <author>大款和花花</author>
      <pubDate>Sun, 24 May 2026 01:24:30 +0000</pubDate>
    </item>
    <item>
      <title>Antrophic is now the front runner of AI Boom</title>
      <link>https://www.17gw.com/thread-6857-1-1.html</link>
      <description><![CDATA[]]></description>
      <category>AI 评测与前沿</category>
      <author>恒国</author>
      <pubDate>Fri, 15 May 2026 15:17:50 +0000</pubDate>
    </item>
    <item>
      <title>最近一次使用ChatGPT 5.5 Pro的体验  标题平平无奇，内容却让整个数学圈坐不住了。</title>
      <link>https://www.17gw.com/thread-6823-1-1.html</link>
      <description><![CDATA[今天，菲尔兹奖得主Timothy Gowers在个人博客上发了一篇长文——


最近一次使用ChatGPT 5.5 Pro的体验

标题平平无奇，内容却让整个数学圈坐不住了。

文中，他亲手验证了一个令整个数学界不寒而栗的事实：

GPT-5.5 Pro，用了不到两个小时，独立完成了一项博士论文级 ...]]></description>
      <category>AI 评测与前沿</category>
      <author>怀哥</author>
      <pubDate>Sun, 10 May 2026 06:23:57 +0000</pubDate>
    </item>
    <item>
      <title>索尼 AI 发布的一段视频显示</title>
      <link>https://www.17gw.com/thread-6764-1-1.html</link>
      <description><![CDATA[索尼 AI 发布的一段视频显示


展示了一个代号为 Ace 的自主乒乓球机器人

再正式规则下和人类高水平选手对打的画面

该机器人在与顶尖人类球员的对决中不仅能轻松应对，有时甚至能将人类选手击败...

乒乓球运动是一项需要高速感知、实时决策、精确执行的竞争性运动

 ...]]></description>
      <category>AI 评测与前沿</category>
      <author>sinalook</author>
      <pubDate>Thu, 23 Apr 2026 16:35:40 +0000</pubDate>
    </item>
  </channel>
</rss>