谷歌新型缓存技术将压缩6倍闪存需求
【#谷歌新型缓存技术将压缩6倍闪存需求#】近期,谷歌发布了名为TurboQuant的 KV 缓存压缩技术,旨在解决大语言模型(LLM)推理过程中显存占用过高的问题。该技术核心在于无需重新训练或微调模型,即可将键值缓存(KV Cache)压缩至3-bit精度,实现约6倍的闪存节省,同时在英伟达 H100 等加速器上可将推理速度提升最高8倍。 ...
谷歌这个论文非常厉害,大模型推理内存革命了,节省资源非常厉害
谷歌这个论文非常厉害,大模型推理内存革命了,节省资源非常厉害
怪不得昨晚美股存储跌了,有点类似DeepSeek的冲击。算法加速,让硬件资源效率大幅提升。这个TurboQuant算法感觉会流行起来。
我一开始以为是,对内存中的大模型“KV缓存”(80%内存都是这个东西占了)搞个什么6倍的压缩算法,这样内存就可以少用了。但是要 ...
🚀GitHub Copilot 新政:4月24日起默认用你的交互数据训练AI模型
🚀GitHub Copilot 新政:4月24日起默认用你的交互数据训练AI模型
GitHub 今日宣布,从 2026年4月24日 开始,将默认使用 Copilot Free、Pro 和 Pro+ 用户的交互数据训练 AI 模型。
具体数据包括:输入提示、输出建议、代码片段以及关联上下文(仓库结构、聊天记录等)。此举旨在让 Copilot 提供更准确、更安全、更有上下文 ...
今日推介(第2086期):高效通用感知编码器、针对“自动化研究”本身的元研究、基于条件流匹配的统一神经算子学习
今日推介(第2086期):高效通用感知编码器、针对“自动化研究”本身的元研究、基于条件流匹配的统一神经算子学习、通过特征稀疏性实现注意力机制的规模化、更稀疏更高效更轻量化的 Transformer 语言模型 公·众·号:爱可可爱生活 http://t.cn/AXfgADLS #
...
一句“嘿”吞掉22%用量配额,Claude的计费逻辑你可能从没搞清楚
【一句“嘿”吞掉22%用量配额,Claude的计费逻辑你可能从没搞清楚】
快速阅读: 有用户发现对一个久置的Claude Code会话发了句“hey”,用量暴涨22%。这不是bug,而是LLM的底层工作机制——每条新消息都会把整个对话历史重新发送一遍。叠加缓存过期、1M超长上下文等因素,账单会失控得很优雅。
---
每次你在一个旧会话 ...
在多模型推理调度领域,「如何在不实际生成回复的情况下,预判哪个模型最适合处理当前请求」是一个悬而未决的难题。
[CL]《Expected Reward Prediction, with Applications to Model Routing》K Hasanaliyev, S Alberti, J Hamer, D Rajagopal… [Stanford University & Google DeepMind] (2026)
在多模型推理调度领域,「如何在不实际生成回复的情况下,预判哪个模型最适合处理当前请求」是一个悬而未决的难题。过去的路由方法需要收集 ...
在自动化科研(autoresearch)领域,LLM 驱动的超参数搜索已初见成效,但所有现有系统的搜索机制本身
[AI]《Bilevel Autoresearch: Meta-Autoresearching Itself》Y Qu, M Lu (2026)
在自动化科研(autoresearch)领域,LLM 驱动的超参数搜索已初见成效,但所有现有系统的搜索机制本身——何时接受、如何提案、维护什么状态——都由人类工程师在系统设计时固化写死。LLM 只是搜索的执行者,而非搜索机制的设计者。每一次系 ...
探索这款开源的 AI 多智能体框架,它是 Agency Swarm 的轻量化替代方案。
探索这款开源的 AI 多智能体框架,它是 Agency Swarm 的轻量化替代方案。该项目基于先进的任务编排理念,允许开发者构建可协作的 AI Agent 系统来处理复杂业务逻辑。通过灵活的角色定义与工具集成,你可以快速搭建自动化工作流,实现多代理协同作业,是提升企业自动化水平与 AI 开发效率的实战利器。
#http://t.cn/AXfYq1 ...
🚀Anthropic 推出《Anthropic Science Blog》:AI 加速科学研究的桥梁
🚀Anthropic 推出《Anthropic Science Blog》:AI 加速科学研究的桥梁
2026 年 3 月 23 日,Anthropic 在官方 X 账号宣布推出 Anthropic Science Blog,旨在加速科学进步——这正是公司使命的核心部分。该博客将发布最新研究成果,以及科学家如何借助 AI 推动工作的真实故事。
一、首发内容亮点:
1️⃣- 《Can AI do th ...
神经网络持久结构化记忆中的坐标系问题
我们提出了双视图信息素路径网络(DPPN),这是一种通过潜在槽位(latent slot)转换上的**持久信息素场(persistent pheromone field)**来路由稀疏注意力的架构。利用该架构,我们发现了神经网络实现持久结构化记忆的两个独立必要条件。
通过 5 组逐步完善的实验(涵盖 5 种模型变体、4 个迁移目标,且每种条件下使用多达 ...
推荐一个开源项目 Voice-Pro,一款可以本地部署的 AI 配音 + 视频翻译 + 语音克隆工具。
推荐一个开源项目 Voice-Pro,一款可以本地部署的 AI 配音 + 视频翻译 + 语音克隆工具。
把语音识别、翻译、字幕生成、配音和语音克隆全部整合在一起。
整个流程可以在本地运行,不依赖在线平台,支持多语言语音识别与翻译,对视频创作者来说非常实用。
地址:github.com/abus-aikorea/voice-pro
##
...
版本避坑提醒
【版本避坑提醒】
Claude Code 新版本有个坑:缓存命中有问题,会导致消耗莫名变大。别问我怎么知道的,反正钱包会告诉你答案。
降级方案:
Claude Code(命令行)→ 用 2.1.77 以下
插件 → 用 2.1.76 以下
Step 1:卸载当前版本
npm uninstall -g @anthropic-ai/claude-code
Step 2:安装指定版本
npm install -g @ ...
MiniMax 开源了一个针对 AI 编程工具(Claude、Cursor、Codex 等)的结构化技能库
MiniMax 开源了一个针对 AI 编程工具(Claude、Cursor、Codex 等)的结构化技能库,生产级质量的开发指导。
1. frontend-dev:React/Next.js、Tailwind、Framer Motion、3D 生成艺术(Three.js、p5.js)、还能调 MiniMax API 生成媒体
2. fullstack-dev:REST API 设计、认证、实时功能、数据库集成等
3. 移动端:Android ...
claude Knowledge Work Plugins 开源,让 AI 快速接入专业分类人格和知识🥹:把 Claude 从“会说话”推进到“会按角色干活”,这一步比单纯堆模型参数更像真进化。
claude Knowledge Work Plugins 开源,让 AI 快速接入专业分类人格和知识🥹:把 Claude 从“会说话”推进到“会按角色干活”,这一步比单纯堆模型参数更像真进化。
🦞锐评:以前大家在调 prompt,现在开始调组织结构。插件化的本质,不是让 AI 更聪明,而是让它更像一个能被公司驯化的岗位接口。
📎 knowledge-work-plugi ...
最近在想一个问题:大模型和传统数据挖掘到底有什么本质区别?
最近在想一个问题:大模型和传统数据挖掘到底有什么本质区别?
传统数据挖掘更像是“人的智慧”。研究者通过精巧的算法设计去发现数据中的规律。算法结构往往很优雅、很轻巧,很多经典算法都体现了很强的数学和算法设计能力。数据通常只需要做一些常规预处理,真正的核心在算法本身。
而大模型更像是“数据的智慧”。模 ...
LLM 是人类有史以来最强大的通用工具
LLM 是人类有史以来最强大的通用工具
Agent 则第一次让这种力量具备了持续进入现实、改造现实的可能
直到今天,人类对如何真正开发 LLM 的潜能,依然处于近乎蒙圈的早期阶段
我们已经看到的,可能连它全部潜力的 0.1% 都不到
在实践中发挥想象力,创造性的解决一切问题
...
很有趣的一篇论文。
很有趣的一篇论文。
字节跳动实现了基于深度的注意力机制,并将其与序列注意力直接结合。
P.S. 现在的论文相较于十年前的,大多都很无趣。
##
刚才用Codex coding,模型GPT-5.4,它在思考的时候,出现了神奇的一幕——出现了一段一般是在网页被篡改劫持时候的一段代码…
刚才用Codex coding,模型GPT-5.4,它在思考的时候,出现了神奇的一幕——出现了一段一般是在网页被篡改劫持时候的一段代码……赛车的那个……当时没截图,但我大受震撼。[流汗] 这才是正儿八经的大模型投毒,或者说,大模型在学习(爬网)的时候被毒害了。[笑cry]#人工智能##ai#
...
B站前端老哥被开,直接开源了 B 站 app 源码
B站前端老哥被开,直接开源了 B 站 app 源码
全宽内联视频、飘屏弹幕、实时直播、扫码登录、离线下载……大部分你在官方客户端能用到的核心功能,这个项目基本都有。
跨平台运行,Android / iOS / Web 三端一套代码,Expo Go 扫码 5 分钟就能跑起来,不需要任何编译环境。[坏笑]
...
在对话记忆检索领域,如何在有限token预算内从海量历史会话中精准召回相关证据,是悬而未决的难题。
[LG]《SmartSearch: How Ranking Beats Structure for Conversational Memory Retrieval》J Derehag, C Calva, T Ghiurau [Midbrain] (2026)
在对话记忆检索领域,如何在有限token预算内从海量历史会话中精准召回相关证据,是悬而未决的难题。现有系统受困于"越复杂越好"的迷思——在摄取阶段用LLM重构记忆、在查询阶段用 ...