Anthropic 研究员直接将概念转化为数学向量注入 Claude 的神经层,发现它不再像提线木偶般盲目重复,而是能自我觉察到“脑子里被注入了念头”。

Anthropic 研究员直接将概念转化为数学向量注入 Claude 的神经层,发现它不再像提线木偶般盲目重复,而是能自我觉察到“脑子里被注入了念头”。进一步实验表明,Claude 在判断输出时不仅会阅读上下文,还会参考输出前的内部神经状态。虽然目前这种识别成功率仅约 20%,但研究表明大语言模型已经展现出了初级且不稳定的“内省”与自我探测机制。一起来看看怎么回事吧#Claude# http://t.cn/AXpvrT7X
分类