官方消息:Qwen3.8-27B 在 @ArtificialAnlys
官方消息:Qwen3.8-27B 在 @ArtificialAnlys
人工智能指数中获得了 52 分。
我们现在拥有一个开放权重模型,其性能可与 GPT-5.6 Luna(最高分)媲美,并且可以在本地运行……甚至可以在浏览器中使用自定义 WebGPU 内核运行!
真是个激动人心的时代!🤯
...
我是 VS Code 用户。 请给我一个切换到 Cursor 的理由。
我是 VS Code 用户。
请给我一个切换到 Cursor 的理由。
Cheepseek 行动:第一阶段完成
Cheepseek 行动:第一阶段完成
OpenCode Go 订阅用户现在只需 10 美元即可获得价值 30 美元的 Go 使用权
第二阶段启动……
如何从 AI 反馈中提取更丰富的信号?
如何从 AI 反馈中提取更丰富的信号?
隆重推出 LLM-as-a-Verifier✨——一个简单的验证扩展框架,在智能体基准测试中达到了 SOTA 水平🚀
核心思想:
- 使用更细粒度的评分(例如,1-20 分制,而非标准的 1-5 分制)
- 计算分数标记的完整对数概率分布的期望值
- 扩展重复评估和准则分解
您可以利用这些细粒度信号,实 ...
使用 DeepSeek V4 Flash 进行自验证扩展,在 Terminal-Bench 2.1 测试中超越了 Claude Fable 5,成本却降低了 11 倍💰
使用 DeepSeek V4 Flash 进行自验证扩展,在 Terminal-Bench 2.1 测试中超越了 Claude Fable 5,成本却降低了 11 倍💰
随着开源模型能力的不断提升,它们现在可以生成大量高质量的候选解,并以极低的成本验证自身的输出。
例如,我们发现,仅使用 DeepSeek V4 Flash 采样 5 个解,并使用 LLM-as-a-Verifier 对它们进行排 ...
deepseek harness现在还是开发者预览版,非技术人员人可能直接安装启动就劝退了。
deepseek harness现在还是开发者预览版,非技术人员人可能直接安装启动就劝退了。这个项目把deepseek harness包装成了一个桌面应用,下载打开就可以直接用了
地址:github.com/anywhere-labs/deepseek-harness-desktop
主要功能
将 DeepSeek Harness 打包为原生桌面应用
自动启动和管理本地 Harness 服务
无需 ...
Anthropic 研究员直接将概念转化为数学向量注入 Claude 的神经层,发现它不再像提线木偶般盲目重复,而是能自我觉察到“脑子里被注入了念头”。
Anthropic 研究员直接将概念转化为数学向量注入 Claude 的神经层,发现它不再像提线木偶般盲目重复,而是能自我觉察到“脑子里被注入了念头”。进一步实验表明,Claude 在判断输出时不仅会阅读上下文,还会参考输出前的内部神经状态。虽然目前这种识别成功率仅约 20%,但研究表明大语言模型已经展现出了初级且不稳定的“内 ...
yetone 开源了一个新项目 Cumora:把 AI Agent 变成你的聊天群里的正式成员。
yetone 开源了一个新项目 Cumora:把 AI Agent 变成你的聊天群里的正式成员。
Cumora 的界面长得像 Slack,但名单上的同事看起来都是 AI。有名字、有人设、有记忆,能发私聊、能建群、能认领任务,甚至能收发真实邮件。你不 @ 它们,它们也可能主动跳出来说一句“我注意到上周那个问题还没解决”。
从截图看,默认团队里 ...
Grok 4.6 刚刚跻身人工智能医疗保健指数前三名
Grok 4.6 刚刚跻身人工智能医疗保健指数前三名
Grok 4.6(高阶版)得分 50 分,仅比最高分 51 分低 1 分。
它的表现优于 GPT-5.6 Sol、Kimi K3 和 Gemini 3.7 Flash。
该指数衡量模型在医疗保健和医疗工作中的实际表现:
• 医学和健康知识
• 临床推理
• 患者文档记录
• 非幻觉性
• 智能体工作流程
医疗保健是 ...
隆重推出 GLM-5.3:专为编码而生,随时准备迎接网络防御挑战。
隆重推出 GLM-5.3:专为编码而生,随时准备迎接网络防御挑战。
- 顶级编码和智能体能力,通过对 743B 基础模型进行后续训练而实现。
- 网络安全领域的重大飞跃,为开放模型树立了新的标杆。
技术博客:https://z.ai/blog/glm-5.3
...
GPT6真要比GTA6早来了…
微软悄悄开源了市面上最好的 AI 数据分析工具之一。
微软悄悄开源了市面上最好的 AI 数据分析工具之一。
它叫做 data-formulator。
连接任何数据源,CSV、Postgres、BigQuery,甚至是实时 URL,然后用拖拽和纯英文混合的方式构建图表。
AI 代理在底层编写 SQL 并进行转换,然后递给你一个真正可以编辑的图表,而不是一堆代码。
- 将字段拖到 x/y/颜色上,它就会构建图表
...
DeepSeek Harness 部署指南
这份指南带你在一台 Mac 上完成 DeepSeek Harness 的本地启动、模型配置、工作区选择和最小对话验证。完成后,你会得到一个运行在 http://127.0.0.1:3080 的本地 Web UI ,并能让 Harness 在指定工作区内处理文件任务。
一、准备工作
- 一台已安装 Node.js 与 npm 的 Mac ;
- 可访问 DeepSeek API 开放平台的账号;
- 一 ...
让 Codex 直接用 Kimi K3 的 Responses API 适配层
我写了一个把 OpenAI Responses API 转成 Kimi Coding 的 Anthropic Messages API 的工具,欢迎大家使用。原因:new-api 协议转换不好用,sub2api 转换 Responses-> Messages 的也不好使,给 sub2api 提 PR 也没什么反馈,也不想自己维护 fork 。干脆自己写个转换服务得了。代码是 kimi3 在 codex 中写的,自己也在用,kimi ...
不儿? GLM-5.3的测试分数是怎么翻6倍的?
不儿? GLM-5.3的测试分数是怎么翻6倍的?
有一说一这个分数飞升有点猛了, 按我对 Terminal Bench 3.0 的理解, 里面的任务是实打实的难的.
比如这个 exam-pdf-eval, 就是个给考试试卷(PDF格式)评分的任务, 模型并不是自己直接解析PDF然后阅卷评分的, 而是要调用一个VLM, 然后自己写prompt, 让 VLM 抽取试卷内容, 然后再评分 ...
Grok 4.6快的飞起,也非常强 那能不能在WorkBuddy里调用Grok 4.6呢
Grok 4.6快的飞起,也非常强
那能不能在WorkBuddy里调用Grok 4.6呢
我问了下Grok
有一个方式很简单
一行命令完成安装:
npx skills add zjp1997720/zhijian-skills --skill workbuddy-cli-model-bridge
安装完成后,新开个窗口:
“把grok 4.6模型桥接到WorkBuddy,走 chat/completions,不要用 Responses 协议”
这个 ...
Qwen 3.8-27B:本地大模型正在拆掉网络安全的“技术护城河”
【Qwen 3.8-27B:本地大模型正在拆掉网络安全的“技术护城河”】一位资深网络安全分析师在社区投下重磅炸弹:Qwen 3.8-27B 在恶意软件分析和漏洞利用上的表现,已经跨过了本地模型与闭源旗舰模型(如 Claude Opus)的性能分水岭。这不仅是一个新模型的发布,更意味着过去需要国家级黑客团队或顶尖分析师耗费数周才能完成的 ...
Anthropic 的篇官方技术说明,解释 Claude 文本水印的具体工作方式。
Anthropic 的篇官方技术说明,解释 Claude 文本水印的具体工作方式。
Claude 用的是 Google DeepMind 2024 年发表在《Nature》上的 SynthID-Text 方案,往上追溯可以到 Scott Aaronson 2022 年的提案。这一脉方案的共同特征是在模型选词时,用密钥改变随机数的来源,从而在输出中留下统计痕迹。
Anthropic 举了个例子帮助 ...
把今天全球最先进的模型部署在自己的电脑上并非不可能。
把今天全球最先进的模型部署在自己的电脑上并非不可能。
你只需要等待 201 天。
今天 Qwen 3.8 27B 的性能,可以和 201 天之前的最先进的 Claude Opus 4.6 持平了,而且可以本地部署。
DeepSeek开源了自己的工程SOP,这才是Harness真正的宝藏。
DeepSeek开源了自己的工程SOP,这才是Harness真正的宝藏。
DeepSeek Harness 发布的时候,大家的注意力都在框架本身:插件架构、Agent 循环、工具调用。但很少有人注意到仓库里藏着一个不起眼的目录:
.agents/skills/
这个目录里放了11个 Skill 文件,每一个都是 DeepSeek 内部真实在用的工程规范。换句话说,他们把自 ...