让 Codex 直接用 Kimi K3 的 Responses API 适配层
我写了一个把 OpenAI Responses API 转成 Kimi Coding 的 Anthropic Messages API 的工具,欢迎大家使用。原因:new-api 协议转换不好用,sub2api 转换 Responses-> Messages 的也不好使,给 sub2api 提 PR 也没什么反馈,也不想自己维护 fork 。干脆自己写个转换服务得了。代码是 kimi3 在 codex 中写的,自己也在用,kimi ...
不儿? GLM-5.3的测试分数是怎么翻6倍的?
不儿? GLM-5.3的测试分数是怎么翻6倍的?
有一说一这个分数飞升有点猛了, 按我对 Terminal Bench 3.0 的理解, 里面的任务是实打实的难的.
比如这个 exam-pdf-eval, 就是个给考试试卷(PDF格式)评分的任务, 模型并不是自己直接解析PDF然后阅卷评分的, 而是要调用一个VLM, 然后自己写prompt, 让 VLM 抽取试卷内容, 然后再评分 ...
Grok 4.6快的飞起,也非常强 那能不能在WorkBuddy里调用Grok 4.6呢
Grok 4.6快的飞起,也非常强
那能不能在WorkBuddy里调用Grok 4.6呢
我问了下Grok
有一个方式很简单
一行命令完成安装:
npx skills add zjp1997720/zhijian-skills --skill workbuddy-cli-model-bridge
安装完成后,新开个窗口:
“把grok 4.6模型桥接到WorkBuddy,走 chat/completions,不要用 Responses 协议”
这个 ...
Qwen 3.8-27B:本地大模型正在拆掉网络安全的“技术护城河”
【Qwen 3.8-27B:本地大模型正在拆掉网络安全的“技术护城河”】一位资深网络安全分析师在社区投下重磅炸弹:Qwen 3.8-27B 在恶意软件分析和漏洞利用上的表现,已经跨过了本地模型与闭源旗舰模型(如 Claude Opus)的性能分水岭。这不仅是一个新模型的发布,更意味着过去需要国家级黑客团队或顶尖分析师耗费数周才能完成的 ...
Anthropic 的篇官方技术说明,解释 Claude 文本水印的具体工作方式。
Anthropic 的篇官方技术说明,解释 Claude 文本水印的具体工作方式。
Claude 用的是 Google DeepMind 2024 年发表在《Nature》上的 SynthID-Text 方案,往上追溯可以到 Scott Aaronson 2022 年的提案。这一脉方案的共同特征是在模型选词时,用密钥改变随机数的来源,从而在输出中留下统计痕迹。
Anthropic 举了个例子帮助 ...
把今天全球最先进的模型部署在自己的电脑上并非不可能。
把今天全球最先进的模型部署在自己的电脑上并非不可能。
你只需要等待 201 天。
今天 Qwen 3.8 27B 的性能,可以和 201 天之前的最先进的 Claude Opus 4.6 持平了,而且可以本地部署。
DeepSeek开源了自己的工程SOP,这才是Harness真正的宝藏。
DeepSeek开源了自己的工程SOP,这才是Harness真正的宝藏。
DeepSeek Harness 发布的时候,大家的注意力都在框架本身:插件架构、Agent 循环、工具调用。但很少有人注意到仓库里藏着一个不起眼的目录:
.agents/skills/
这个目录里放了11个 Skill 文件,每一个都是 DeepSeek 内部真实在用的工程规范。换句话说,他们把自 ...
【本周GitHub AI 热榜】 这周最明显的信号是,AI Agent 开始从“会聊天、会写代码”,走向“能长期干活”。
【本周GitHub AI 热榜】
这周最明显的信号是,AI Agent 开始从“会聊天、会写代码”,走向“能长期干活”。
1. reverse-skill
GitHub: https://github.com/zhaoxuya520/reverse-skill
本周新增 9,784 星。
这是一个 AI 安全技能路由包,面向逆向工程和渗透测试场景。它解决的问题很具体:AI 编码助手遇到 APK、二 ...
写 SQL 写到一半,想查看表结构,却发现还得切换到另一个工具才能查找——这种突兀的切换感,你懂的吧?
写 SQL 写到一半,想查看表结构,却发现还得切换到另一个工具才能查找——这种突兀的切换感,你懂的吧?
Tabularis 能帮你轻松解决这个问题。它是一款开源的桌面 SQL 工作台,支持超过 15 种数据源,包括 PostgreSQL、MySQL、SQLite、DuckDB、ClickHouse、Redis、Firestore 等等。
它的杀手锏是内置的 MCP 服务器,让 Cla ...
AI 代理现在不仅可以操作浏览器,甚至可以控制真正的 iPhone
AI 代理现在不仅可以操作浏览器,甚至可以控制真正的 iPhone
这个开源项目名为 Phone Harness
它直接利用了 macOS 的 iPhone 镜像功能:
- 使用视觉 OCR 识别屏幕文本和坐标
- 使用系统级事件完成点击、长按、滑动和输入
- 操作后截屏以验证结果是否正确
- 无需越狱、Xcode 或 WebDriverAgent
我的看法:它不是 iPho ...
Freebuff 已经将 DeepSeek V4 Pro Flash 等模型免费提供给开发者使用,而且已经有 24 万开发者在用了😲😲😲
我的天,DeepSeek V4 Flash 居然免费?!
Freebuff 已经将 DeepSeek V4 Pro Flash 等模型免费提供给开发者使用,而且已经有 24 万开发者在用了😲😲😲
Freebuff 的模式是用户完全免费,AI Token 的费用由广告商承担。
他们刚刚宣布 DeepSeek V4 Pro 可以 100% 免费使用。其背后的 Freebuff 平台已经拥有 243,958 位开发者 ...
本周GitHub AI 热榜
【本周GitHub AI 热榜】
这周最明显的信号是,AI Agent 开始从“会聊天、会写代码”,走向“能长期干活”。
1. reverse-skill GitHub: https://github.com/zhaoxuya520/reverse-skill本周新增 9,784 星。这是一个 AI 安全技能路由包,面向逆向工程和渗透测试场景。它解决的问题很具体:AI 编码助手遇到 APK、二进制、JS ...
[AI]《Thought-Level Beam Search for Reasoning》L Yang, H Luo, T Dao, R Netravali [Princeton University & MIT & Meta AI] (2026)
[AI]《Thought-Level Beam Search for Reasoning》L Yang, H Luo, T Dao, R Netravali [Princeton University & MIT & Meta AI] (2026)
在大型模型推理领域,如何在固定算力下高效探索解题路径是一个悬而未决的难题。过去的方法受困于“并行采样”的内存溢出与“剪枝”的算力闲置,本质原因是它们无法将从失败路径释放的 ...
我只是作为一个“普通用户”的角度去用 DeepSeek Harness,一些感受
我只是作为一个“普通用户”的角度去用 DeepSeek Harness,一些感受:
1. 启动方式偏极客,程序员没问题,但是普通用户估计都没有nodejs环境,很难跑起来
2. 速度飞快,这点特别好
3. Thinking 部分由于 Flash 模型速度过快,导致文字闪的厉害,可以做一下节流,攒一批一起显示,配合动效会好一点。
4. Codex 右侧的多 ...
DeepSeek发布V4Pro正式版
#DeepSeek发布V4Pro正式版#
这次V4Pro正式版升级真的诚意满满,重点强化Agent智能体能力,原生适配Responses API和Codex,写代码、自动调用工具完成复杂任务表现远超不少开源模型。数学推导、全栈开发、长文档分析全场景无短板,极限推理模式下逻辑严谨度比肩顶级闭源大模型
...
告别Prompt玄学:为什么顶级实验室都在搞“马具”工程?
【告别Prompt玄学:为什么顶级实验室都在搞“马具”工程?】最近开源的《Learn Harness Engineering》课程引起了圈内关注,它把AI落地的重心从调教Prompt转移到了构建“Harness”(驾驭系统)上。该项目深度拆解了OpenAI与Anthropic的内部工程方案,其重点不是去拔高模型的天花板,而是通过环境设计、状态监控和闭环验证, ...
从榜单看,都是Fable级别
2022年的 AI vs 2026年的 AI
Claude 打破平台壁垒:Chrome 侧边栏 AI 对话互通全平台历史记录
【Claude 打破平台壁垒:Chrome 侧边栏 AI 对话互通全平台历史记录】Anthropic 今天(8 月 13 日)在 X 平台发布推文,宣布升级适用于谷歌 Chrome 浏览器的 Claude 扩展程序,在侧边栏带来完整的 Claude Cowork 会话体验。
一张图,跑出一条 3D 资产生产线
一张图,跑出一条 3D 资产生产线
刚刷到一个 GitHub 项目,名字叫 img2threejs,看完直接给我整懵了,太离谱了。
它干的事特别简单:你给它一张参考图,它就让 Agent 把这个物体重建成纯代码的 Three.js 模型。注意,是纯代码,没有模型文件,也没有贴图,整个物体就是一段代码,扔进浏览器就能跑。
更妙的是,它能跟 Co ...