订阅

AI 评测与前沿 今日: 0|主题: 220|排名: 24 

  • 隐藏置顶帖 置顶 一起港湾 (17GW.com) 论坛发帖须知
    欢迎来到 一起港湾 (17GW) 社区!这里是 AI 技术爱好者、数码极客和生活分享者的精神家园。为了维护港湾的纯净秩序与技术氛围,请在开启您的分享之旅前,仔细阅读并遵守以下发帖规范。 一、 核心发帖准则 [*]主题契合,精准归类:请确保内容与所属版块(如 AI 技术、数码维修、资源分享等)相关。标题应简明扼要,避免“ ...
    1726 teanzhong 发表于 2026-3-29 站务公告与反馈
  • 今日AI热点(3.23)
    今日AI热点(3.23) 1. 英伟达NemoClaw发布:为OpenClaw打造企业级安全栈,三层防护解决部署风险 2. 黄仁勋高度评价OpenClaw:称其为史上最重要软件发布,普及速度超Linux 3. GPT-5 Codex定价出炉:输入$1.25/百万token,输出$10/百万token,专业能力强劲 4. MoltMatch事件:暴露AI智能体安全隐患,加速企业级安全方案落 ...
    1367 苯鸟 发表于 2026-3-24 AI 评测与前沿
  • 🚨对比测评:神秘模型 Ox Alpha 性能封神! New
    🚨对比测评:神秘模型 Ox Alpha 性能封神! OpenCode 刚放出的 stealth 模型 Ox Alpha,在 DeepSWE 10 个硬核任务实测中直接碾压一众一线模型,平均分高达 80%,把大家都整不会了。 关键要点拆解: 🔹实测成绩(10 任务均值)
• Ox Alpha:80%(8 个任务全过 ✓,仅 2 个 ×,且有接近过线)
• fable-5:65%
• glm ...
    020 王允林 发表于 4 天前 AI 评测与前沿
  • Grok 4.6 刚刚在 MedAgentBench 上排名第一......这是现实世界代理医疗保健任务最有趣的基准之一 New
    Grok 4.6 刚刚在 MedAgentBench 上排名第一......这是现实世界代理医疗保健任务最有趣的基准之一 现在,Grok 有两代人跻身前三名 • #1 Grok 4.6 — ~95.9% • #2 GPT-5.6 Sol — ~94.7% • #3 Grok 4.5 — ~93.4% MedAgentBench 远远超出了回答医疗问题的范围 它在真实的电子健康记录环境中针对 10 个类别的 300 项临 ...
    018 皮埃尔 发表于 5 天前 AI 评测与前沿
  • DeepSeek V4 Pro 正式版测评来了,SuperCLUE 综合总榜第2。 New
    DeepSeek V4 Pro 正式版测评来了,SuperCLUE 综合总榜第2。 对比预览版,几个关键数字变化挺大:智能体编程 47.37→63.16(+15.85),幻觉控制 79.70→89.73,任务规划也涨了6.48分。推理耗时同步优化了,不是纯堆分。 精确指令遵循小幅下滑,开发团队明显优先强化长链路智能体和深度推理。支持百万级长文本,开源。 跟 ...
    016 木朵 发表于 5 天前 AI 评测与前沿
  • 24 人团队,撬动 AI 芯片格局,Taalas 被 AMD 收购背后,是算力战场的转向。 New
    24 人团队,撬动 AI 芯片格局,Taalas 被 AMD 收购背后,是算力战场的转向。 不同于英伟达通用 GPU 路线,Taalas 选择牺牲通用性,将模型直接固化进硬件,绕开 HBM 内存墙,实现超低延迟推理,但缺点也很明显:一块芯片只能跑一套模型,灵活性大打折扣。 AMD 这次收购,瞄准的正是高速推理赛道。 在训练市场竞争之外,推 ...
    049 王吉杨 发表于 5 天前 AI 评测与前沿
  • LLM-as-a-Verifier 不断突破性价比的极限! New
    LLM-as-a-Verifier 不断突破性价比的极限! 在 Terminal-Bench 2.1 测试中,它将 DeepSeek V4 Flash 的准确率从 79% 提升至 88%,而价格却比竞争对手低 4 到 11 倍! 点击此处体验:https://github.com/llm-as-a-verifier/llm-as-a-verifier @jackyk02
    021 我爱榛子 发表于 6 天前 AI 评测与前沿
  • 阿里巴巴刚刚发布了它所缺少的那一块拼图 它叫 OpenSandbox。
    🚨中国人又干了一票!! 阿里巴巴刚刚发布了它所缺少的那一块拼图 它叫 OpenSandbox。 真正的隔离环境,让你的代理随心所欲。 里面可以运行什么: → Claude Code、Codex CLI、Gemini CLI、Qwen Code 和 Kimi CLI → Chrome 和 Playwright 用于自动化浏览 → 通过 VNC 的完整桌面 → 浏览器中的 VS Code → 多语言代码 ...
    075 音乐人闭能文 发表于 2026-8-17 AI 评测与前沿
  • 三星开始让AI造芯片了:一个月的工作压缩到两天,Exynos研发迎来新变量
    三星开始让AI造芯片了:一个月的工作压缩到两天,Exynos研发迎来新变量 如果一个原本需要一个多月才能完成的芯片研发任务,现在两天就能搞定,会发生什么? 三星正在给出一个很有意思的答案。 根据韩国媒体最新报道,三星电子 System LSI 事业部从今年 5 月开始正式将 Anthropic 的 Claude Code 引入半导体研发,而且已 ...
    074 爱深求 发表于 2026-8-17 AI 评测与前沿
  • #DeepSeekHarness发布# 【DeepSeek Harness 真正狠的地方,是它没有"核心"】
    #DeepSeekHarness发布# 【DeepSeek Harness 真正狠的地方,是它没有"核心"】 DeepSeek 的 agent 框架 Harness 上线三天,39,735 个 star。多数人当它是又一个 Coding 工具,但架构文档开头就写了它的定位:no privileged core,没有特权核心。 Claude Code、Codex 的内核是内置写死的。想加能力,走 MCP,在外部挂插件。a ...
    059 想拒绝呼吸 发表于 2026-8-16 AI 评测与前沿
  • 黄仁勋9大预言!3年后机器人满街跑,AI将重塑世界。
    黄仁勋9大预言!3年后机器人满街跑,AI将重塑世界。 他是黄仁勋,英伟达“皮衣刀客”,手握全球AI算力命脉。2026年最新9大预言,每一条都将改变未来! 1、生成式AI只是开胃菜,智能体AI才是主菜,3年内爆发 2、3–5年机器人无处不在,走进家庭工厂 3、物理AI催生50万亿产业,2026是落地元年 4、数据中心变Token工厂,2 ...
    0432 大款和花花 发表于 2026-5-24 AI 评测与前沿
  • Antrophic is now the front runner of AI Boom
    0353 恒国 发表于 2026-5-15 AI 评测与前沿
  • 最近一次使用ChatGPT 5.5 Pro的体验 标题平平无奇,内容却让整个数学圈坐不住了。
    今天,菲尔兹奖得主Timothy Gowers在个人博客上发了一篇长文—— 最近一次使用ChatGPT 5.5 Pro的体验 标题平平无奇,内容却让整个数学圈坐不住了。 文中,他亲手验证了一个令整个数学界不寒而栗的事实: GPT-5.5 Pro,用了不到两个小时,独立完成了一项博士论文级别的数学研究。 而Gowers本人在整个过程中,数学贡献 ...
    0301 怀哥 发表于 2026-5-10 AI 评测与前沿
  • 索尼 AI 发布的一段视频显示
    索尼 AI 发布的一段视频显示 展示了一个代号为 Ace 的自主乒乓球机器人 再正式规则下和人类高水平选手对打的画面 该机器人在与顶尖人类球员的对决中不仅能轻松应对,有时甚至能将人类选手击败... 乒乓球运动是一项需要高速感知、实时决策、精确执行的竞争性运动 球速通常在 70到100 km/h... 机器人需要再不到 0.1 秒 ...
    0355 sinalook 发表于 2026-4-24 AI 评测与前沿
  • Token消耗榜挺有意思的… ​​​
    0346 Oracle 发表于 2026-4-14 AI 评测与前沿
  • 【AIGC日报】2026.4.12 | 今日要闻速览
    【AIGC日报】2026.4.12 | 今日要闻速览 1、智谱GLM-5.1编程能力首超GPT-5.4,国产算力闭环跑通 2、阿里Wan 2.7-Video正式发布,AI视频迈入「导演时代」 3、OpenAI GPT-6官宣4月14日发布,200万token超长上下文 4、DeepSeek V4确认4月下旬发布,万亿参数+国产芯片适配 5、华为新一代算力芯片发布,性能达英伟达H20的2.87倍 ...
    0334 小川8433651 发表于 2026-4-12 AI 评测与前沿
  • 据传 Anthropic 正在测试一个代号为「Conway」的突破性新项目,一个“永远在线”的 AI Agent
    据传 Anthropic 正在测试一个代号为「Conway」的突破性新项目,一个“永远在线”的 AI Agent,Claude 从被动的 ChatBot 转变为自主的 Digital Twin!怎么感觉这是 Anthropic 的 Siri,也期待今年 WWDC Siri 的框架大更新 ✨ http://t.cn/AXImXDLf ​​​ ...
    0345 湖泊 发表于 2026-4-10 AI 评测与前沿
  • 微软发布 Harrier 系列嵌入 AI 模型,MTEB-v2 基准测试超越谷歌夺冠
    【微软发布 Harrier 系列嵌入 AI 模型,MTEB-v2 基准测试超越谷歌夺冠】微软必应(Bing)团队于 4 月 7 日发布博文,宣布为满足现代 AI 智能体系统对信息处理的高标准需求,开源推出业界领先的文本嵌入模型系列 Harrier,该模型在多语言 MTEB-v2 基准测试中排名第一。 ​​​ ...
    0334 大贤良师 发表于 2026-4-9 AI 评测与前沿
  • 阿里 AI 进入战时体制:打通模型、云与业务的全链路
    【阿里 AI 进入战时体制:打通模型、云与业务的全链路】 快速阅读:阿里巴巴通过全员信宣布重大组织调整,核心在于将AI战略从单纯的技术探索转向规模化商业落地。通过成立集团技术委员会并升级通义实验室为事业部,阿里试图打破业务壁垒,实现模型、云基础设施与应用场景的深度集成。 --- 这次调整更像是一次系统级的内 ...
    0312 快乐购物 发表于 2026-4-9 AI 评测与前沿
  • Seedance2.0 最大的竞争对手来了,Artificial Analysis 突然冒出一匹黑马,没有官网,没有论文,没有任何公开信息
    Seedance2.0 最大的竞争对手来了,Artificial Analysis 突然冒出一匹黑马,没有官网,没有论文,没有任何公开信息,HappyHorse 盲测超越 Seedance 2.0 登顶第一 。 大家猜一猜,HappyHorse 这是谁家的快乐马,不对,黑马啊? 大概率是国产的。 ## ​​​ ...
    0338 爱花花爱莎莎 发表于 2026-4-8 AI 评测与前沿
  • Redis作者 antirez 的一项实验,这里GPT 5.4 要优于Claude Opus
    Redis作者 antirez 的一项实验,这里GPT 5.4 要优于Claude Opus ----------------------------- 过去一周里,我分别对 Claude Code Opus 4.6 和 Codex GPT 5.4 跑了很长时间的自主会话,两者都开到了最大思考预算。它们运行在各自克隆出的目录中;只要其中一边落后了,我就会重新刷新目录。我为此消耗了大量 token(按固 ...
    0469 埋葬冬天的回忆 发表于 2026-4-8 AI 评测与前沿
  • 下一页 »

    快速发帖

    还可输入 120 个字符
    您需要登录后才可以发帖 登录 | 立即注册

    本版积分规则

    关注公众号

    相关侵权、举报、投诉及建议等,请发 E-mail:2776601884@qq.com

    Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.|青ICP备2025004122号-1

    在本版发帖
    关注公众号
    返回顶部