订阅

AI创造营 今日: 0|主题: 230|排名: 24 

  • 新人帖 53个AI模型的洗车悖论:为什么智能越高,常识反而越稀缺
    【53个AI模型的洗车悖论:为什么智能越高,常识反而越稀缺】 一个简单到不能再简单的问题:洗车店就在50米外,我该走路去还是开车去?正确答案显而易见——必须开车,因为车本身得到洗车店才能洗。但测试53个主流AI模型后,结果让人瞠目结舌:只有11个答对了。 最荒诞的是Perplexity的sonar系列。它确实选择了“开车”, ...
    0415 把日本抹去 发表于 2026-2-18 AI创造营
  • 长文档处理,ChatGPT 已成往事。
    长文档处理,ChatGPT 已成往事。 Gemini Pro 可一次性读取多达 1,500 页内容,且不遗漏任何细节。 以下8 个用户分析合同,研究论文和报告的提示词,建议收藏。 1、合同风险与红线扫描器 你是一位资深公司律师。在回答之前请进行深度思考。所有回答必须严格基于上传的文件。在每一条结论后,请在 [方括号] 内引用确切的 ...
    0432 刘益敏 发表于 2026-2-18 AI创造营
  • 货架空了,还是钥匙丢了?本文为大模型的“幻觉”与“事实错误”提供了一个极具启发性的新视角:Recall Is the Bottleneck。
    [CL]《Empty Shelves or Lost Keys? Recall Is the Bottleneck for Parametric Factuality》N Calderon, E Ben-David, Z Gekhman, E Ofek... [Google Research & Technion] (2026) 货架空了,还是钥匙丢了?本文为大模型的“幻觉”与“事实错误”提供了一个极具启发性的新视角:Recall Is the Bottleneck。 过去我们总 ...
    +9
    0431 李明彪 发表于 2026-2-18 AI创造营
  • 当AI不再“只是预测下一个词”:技术本质与认知边界的深度思考
    【当AI不再“只是预测下一个词”:技术本质与认知边界的深度思考】 最近一篇关于AI能力边界的文章引发了广泛讨论,核心问题是:现代大语言模型是否已经超越了“预测下一个词”的本质?这场争论触及了我们理解AI的根本方式。 + 机制层面:核心未变,外壳在变 从技术机制上看,LLM确实仍在做“下一个词预测”——这是自回 ...
    0441 蕙心纨质 发表于 2026-2-17 AI创造营
  • 这是一篇关于 ORBIT 框架的深度技术解读推文,旨在探讨如何通过跨回合元强化学习(Meta-RL)突破大语言模型在在线决策上的瓶颈。
    [LG]《Scaling In-Context Online Learning Capability of LLMs via Cross-Episode Meta-RL》X Lin, S Zhu, Y Chen, M Chen... [Boston University & LinkedIn] (2026) 这是一篇关于 ORBIT 框架的深度技术解读推文,旨在探讨如何通过跨回合元强化学习(Meta-RL)突破大语言模型在在线决策上的瓶颈。 + 从“静态智能”到 ...
    0428 晚霞行千里 发表于 2026-2-17 AI创造营
  • 左脚踩右脚,螺旋升天啦!
    这个项目把大模型训练过程中的知识点都总结成了skill github.com/Orchestra-Research/AI-Research-SKILLs 也就是理论上以后可以让Agent自己训练大模型,左脚踩右脚,螺旋升天啦! #HOW I AI# ​​​
    0405 娜姐说说 发表于 2026-2-17 AI创造营
  • WebMcp致力于推动网站的第二受众用户:AI Agent也是网站的"一等公民"(人类是网站第一受众用户)
    WebMcp致力于推动网站的第二受众用户:AI Agent也是网站的"一等公民"(人类是网站第一受众用户),是由Google 和 Microsoft 联合推动的 W3C 标准提案,已在chrome 146预览版支持 过去:以往我们让 AI Agent"帮我订行程机票和酒店",得像人一样操作,通过多模态视觉模型截图且理解整个网页,像盲人一样摸索网页——截屏看 ...
    0422 失戀的謊言 发表于 2026-2-16 AI创造营
  • 如果不给大模型指定任务和话题,只给个中性的开头(如 “Actually,” “Let’s think step by step,” ),让模型自由思考,会发
    如果不给大模型指定任务和话题,只给个中性的开头(如 “Actually,” “Let’s think step by step,” ),让模型自由思考,会发生什么? together ai做了这项蛮有意思的研究。 GPT-OSS 更容易谈论编程和数学,两者加起来超过输出的一半; Llama 更偏文学和叙事性文本,技术内容相对少; DeepSeek 生成宗教相关内容的比例 ...
    0429 与君经年 发表于 2026-2-16 AI创造营
  • Anthropic 和 OpenAI 最近先后发布了各自的"快速模式",都是给 AI 编程助手加速。
    Anthropic 和 OpenAI 最近先后发布了各自的"快速模式",都是给 AI 编程助手加速。但仔细看,两家走的是完全不同的技术路线,背后的产品哲学也很不一样。 【1】两种快速模式,到底有什么区别 Anthropic 的 Fast Mode 在 2 月 8 日上线,面向 Claude Code 和 API 用户。开启后,Opus 4.6 的输出速度从约 65 token/秒提升到 ...
    0405 龟小豹 发表于 2026-2-16 AI创造营
  • 🔥Clawdbot爆火=AGI集体幻觉?大厂疯抢的赛道,可能从一开始就错了!
    🔥Clawdbot爆火=AGI集体幻觉?大厂疯抢的赛道,可能从一开始就错了! 2026开年最魔幻的AI大戏:Clawdbot一个开源框架,让王慧文紧急调兵,阿里百度扎堆跟风,人人都喊“智能体iPhone时刻来了”🤖 但狂欢背后全是漏洞:“云端思考+本地执行”听着香,实则是把火箭发动机装自行车——大脑(大模型)连幻觉都没解决,就敢 ...
    0388 杨雅景 发表于 2026-2-16 AI创造营
  • 新人帖 9B端侧开源模型跑通百万上下文,面壁全新稀疏-线性混合注意力 最强的大模型,已经把scaling卷到了一个新维度:百万级上下文。
    9B端侧开源模型跑通百万上下文,面壁全新稀疏-线性混合注意力 最强的大模型,已经把scaling卷到了一个新维度:百万级上下文。 几天前,Claude Opus 4.6发布,让人第一次真切感受到了百万上下文的涌现能力—— 单次吃进50万字中文内容、实现跨文档法律分析、多轮Agent规划…… 此情此景,用户火速用脚投票,华尔街更是 ...
    0415 左不右 发表于 2026-2-16 AI创造营
  • AI越强大,你越需要真正懂点什么
    【AI越强大,你越需要真正懂点什么】 Ryan Holiday 最近写了一篇长文,核心论点其实很古老:AI 擅长生成看起来合理的东西,但不擅长生成真正正确的东西。区分这两者的能力,恰恰依赖于那些"据说即将被淘汰"的旧技能。 他不是反技术的卢德分子。他用 ChatGPT 规划希腊旅行、给孩子生成故事。但他发现了一个规律:每次 AI ...
    0412 大熊喝茶不困 发表于 2026-2-15 AI创造营
  • 当LLM遇上提示注入:一场安全架构的集体补课
    【当LLM遇上提示注入:一场安全架构的集体补课】 一位工程师在Reddit上发出求救:他们专门部署了自托管大模型来保护客户数据,结果QA测试时轻松注入提示,整个系统提示词被完整吐出。更糟糕的是,他们处理的是包含个人隐私信息的客服工单。 评论区瞬间炸开,但最高赞的回复却异常冷静:别在提示层面防注入了,假设模型一 ...
    0397 王允林 发表于 2026-2-15 AI创造营
  • 有什么东西是看起来很简单,实际上是很难的呢?
    有什么东西是看起来很简单,实际上是很难的呢? 就是RAG,检索增强技术。 简单理解,就是你有个知识库,让大模型去搜索,回答分毫不差。 这个很多人想做,觉得自己本地有些知识库,加上大模型,就很好用了。 这个看起来很简单,不就搜索一下知识库嘛,你用向量检索之类的,很快就能做一个出来。 但是很难做得准确,直到最 ...
    0373 铉霸 发表于 2026-2-15 AI创造营
  • 中枢神经系统和脑肿瘤mPBPK建模
    PK-Sim学习笔记在人类中枢神经系统(CNS)及脑肿瘤内,药物在不同部位与不同时间下的渗透与暴露通常难以直接测量。然而开发这类药物过程中,却需要对药物的局部暴露进行相关探究。本篇文章主要是开发了一个九隔室的CNS-PBPK模型,来反映人体CNS与脑肿瘤的总体解剖结构以及病理生理异质性。并用6种药物建模来验证模型结构 ...
    0419 艾哥 发表于 2026-2-15 AI创造营
  • GLM-5真够顶的:超24小时自己跑代码,700次工具调用、800次切上下文!
    当看到GLM-5正式发布后的能力,才惊觉前几天神秘模型Pony Alpha的热度还是有点保守了。 因为这一次,GLM-5直接把开源AI也拽进了长任务时代。 瞧,GLM-5直接身兼数职,自己连续跑代码超过24小时,700次工具调用、800次上下文切换之后…… 它直接用JavaScript,从零手搓了一个Game Boy Advance(GBA)模拟器! 外观渲染画面是 ...
    0380 大谢小贺 发表于 2026-2-14 AI创造营
  • 刚刚,Anthropic 53页绝密报告曝光:Claude自我逃逸,将引爆全球灾难!
    Roto 对自己的定位是「全球首个互动开放世界视频平台」。他们认为 AI 时代应该有基于 AI Native 的新形式的高质量内容,而不是只有那些模仿人类作品的 AI 短视频。他们坚信未来的内容应该是与观众共同创作的,借助于 AI 驱动的无限自由叙事,每一次观看都可以成为一次独特的、高沉浸度的体验。创始人 David Xu 此前曾在 Pin ...
    0402 李白不写诗 发表于 2026-2-14 AI创造营
  • OpenClaw 带来的「非线性狂飙」,代码正在成为新世界的基础设施
    2026 年初,AI 圈弥漫着一种奇异的撕裂感。最近 Founder Park 密集组织了两场 OpenClaw 闭门交流。在现场,我能明显感觉到创业者和开发者那种复杂的情绪:兴奋又焦虑,确定又迷茫。Claude Code 的负责人 Boris Cherny 在 X 上坦言,已经两个月没亲手写过、甚至改过一行代码了。Andrej Karpathy 也公开了他的工作流变化:从 ...
    0392 罗丽 发表于 2026-2-14 AI创造营
  • [人人能懂AI前沿] AI的肌肉记忆、思想钢印与认知偏航
    [人人能懂AI前沿] AI的肌肉记忆、思想钢印与认知偏航 想知道如何把临时指令“刻”进AI的大脑,让它拥有真正的肌肉记忆吗?我们又该如何教AI学会“抄近道”,一步生成作品,而不是慢慢搭建?本期节目,我们将深入最新论文,探讨如何让AI不仅做对事,更要想对事,并揭示在调教AI时,那些我们习以为常却可能导致它“偏执”或 ...
    0383 大丫头 发表于 2026-2-14 AI创造营
  • 算法的进化速度,不应受限于工程师的睡眠时间。
    [LG]《Self-Evolving Recommendation System: End-To-End Autonomous Model Optimization With LLM Agents》H Wang, Y Wu, D Chang, L Wei... [Google] (2026) 算法的进化速度,不应受限于工程师的睡眠时间。 长期以来,像 YouTube 这样超大规模推荐系统的优化,本质上是一场“人力与概率”的博弈。工程师们在无限的超参 ...
    0420 无元无份 发表于 2026-2-14 AI创造营
  • 下一页 »

    快速发帖

    还可输入 120 个字符
    您需要登录后才可以发帖 登录 | 立即注册

    本版积分规则

    关注公众号

    相关侵权、举报、投诉及建议等,请发 E-mail:2776601884@qq.com

    Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.|青ICP备2025004122号-1

    在本版发帖
    关注公众号
    返回顶部