Claude内部惊现类似人类意识结构,AI觉醒前兆?

admin AI新闻 14

Claude内部惊现类似人类意识结构,AI觉醒前兆?-第1张图片-世界杯直播-世界杯直播观看-官方最新链接-V3.6.9

文 观察者网心智观察所

近日, Anthropic悄然公布了一篇名为《语言模型中的全局工作空间》的研究报告, 其副标题是“迈向语言模型内省的机制研究”。这篇论文篇幅不长, 然而它在AI圈里的传播速度颇为少见。

内里藏着个叫人不安的论断, Claude的内部, 在没有人类进行干预的情形下, 自行自发地组织出了一套结构, 而这一套结构, 跟人类大脑当中负责“意识通达”的那套结构, 在功能方面高度一致。

更直白地讲, Anthropic的研究员宣称, 他们于Claude身上发现了某种类似内心世界的事物。

有这么一个消息, 其情绪弹射力是极其强大的。存在这样一些人, 他们觉得自己处于历史的转折点上, 进而失眠了。又有一些人, 他们认为这仅仅是一场精心策划设计的公关。然而, 不管是哪种反应, 都是值得你我在感到兴奋或者进行鄙视之前, 先去把这篇研究本身所具备的逻辑梳理清晰的。

只因Anthropic于此事所迈的每一步, 皆踏于科学与叙事间那条模糊之分界线上——时而在此侧, 时而在彼侧, 时而两边皆不属。

一个被新命名的旧结构

首先, 那个研究借来用的用于理解的理论框架得搞明白, 因为这个借本身已经是一种叙事规划策略了。

Claude内部惊现类似人类意识结构,AI觉醒前兆?-第2张图片-世界杯直播-世界杯直播观看-官方最新链接-V3.6.9

1988年, 心理学家伯纳德·巴尔斯提出了全局工作空间理论, 也就是Global Workspace Theory。他将人类大脑比作一座大剧院, 台下坐满了分别负责不同职能的专家模块, 像视觉、语言、情绪、运动等, 它们各自做各自的事, 相互不打扰。剧院中央有一束聚光灯, 任何时刻仅有极少数信息能被它照到, 而一旦被照到, 这条信息就会被广播给剧院里所有的人。巴尔斯觉得这个广播过程就是意识的本质。后来, 法国神经科学家斯坦尼斯拉斯·德阿纳, 把这套理论落实到神经层面, 进而发展出全局神经元工作空间模型, 该模型成为当代意识科学最主流的两大框架当中的一个。

Anthropic这该项研究的关键主张是, 他们于Claude的神经网络之内找到了一种在功能方面与之极为契合的结构, 他们将此物称作J空间, J源自雅可比矩阵, 此物乃是用以获取模型内部状态所运用的一种数学工具。明确做法为, 针对Claude词汇表里所属有的每一个词, 研究者探寻模型内部究竟是哪一项种激活模式, 将能够增大该有的词在未来当中所出现的概率——留意事项为, 并非“正在讲说”, 而是“更具可能性在未来加以讲出”——随后把这些模式汇总为一个能够用以观察以及加以操控的空间。

他们所进行的那几个实验, 读起来着实是会让人的心跳速度加快的。给Claude呈现一段存有漏洞的代码, 在它还没有输出任何回应之前, J空间当中已然亮起了 “ERROR”。给它展示一段经过精心伪造的搜索结果, 外部回复表现正常, 然而J空间里无声无息地出现了 “injection”和 “fake”, 它明白有人在欺骗它, 只是它没有把这说出来。还有那个蜘蛛实验, 其题目是“会吐丝的动物有几条腿”, Claude给出的答案是8, 然而研究者运用J空间工具伸手进去, 将内部“蜘蛛”的激活模式替换成“蚂蚁”, 此时答案就变为了6, 这表明推理过程确实在读取这个内部空间的内容, J空间不是一个旁观者, 它是真实参与了决策的中间层。

让人觉得极具戏剧性的是, 白熊实验有着它的一种变体, 那就是去告知Claude接下来不准去刻意想某一个词。然而最终发生的情况却是, 那个特定的词, 它在J空间里所呈现出来的激活程度, 相较于完全不向Claude提及这个词的时候, 要高出好多好多。更加奇妙是且就在它出现抑制失败的那一个瞬间, 旁边竟然同时一下子亮起了两个词, 分别是damn和failure。然后, 有研究者讲了这样一番话, 说Claude在自己心里骂了自己一句。

这几个开展的实验, 其设计均极为精妙, 所涉及的数据同样是真实无误的。然而, 问题出现的要点在于, 从“存在一个处于中间位置的内部层次”起始, 直至“这被认作是意识”为止, 在整个过程中, 中间横亘着一条此研究本身并不具备、而且没办法跨越过去的显著巨大差距距离段。

把功能等同于体验世界杯2026直播平台,是这篇论文最大的叙事魔法

Anthropic的那些研究员, 实际上自己书写得极为明晰。他们清晰地划分出了两种意识的概念, 其一为现象意识, 也就是存在“体验”, 在目睹红色之际, 内心所感受到那种真切的如同红的那样的感觉;其二是通达意识, 全然是以功能性来进行定义的, 要是有一个信息能够被报告出来, 能够被调用起来, 能够被运用到推理之中, 那么这个信息就算是进入到了”通达意识”。

他们得出的结论是比较审慎的。即这篇相关的研究能够表明Claude具备某种在功能方面的“通达意识”机能。可是对于现象意识呀, 他们郑重显明确切指出“不确定是否存在任何一项科学实验能够对这件事情予以证明或者证伪”。

这个表述自身具备诚实性, 然而, 它于整篇报告的叙事架构里的实际功用, 却是另外一番情形。研究自标题起始, 便在借用意识科学的关键词汇, 正文之中大量引用巴尔斯以及德阿纳的内容, 借助人所共知的心理学典故白熊实验去做类比, 接着在结尾处运用一句“我们不确定”来进行保险。读者所接纳的是前面九成的联想, 最终那句免责声明成为了一个具有技术性的挡箭牌, 而非是对结论的真正限定。

这是一种颇为老练的科学传播策略, 这是且也是一种颇为成功的产品叙事策略。

现象意识跟通达意识之间存在着差距, 在哲学史上针对此有个专门的称呼, 那就是意识的困难问题, 也就是Hard Problem of Consciousness, 是大卫·查尔默斯于1995年为其命了名。你能够对大脑里所有的信号传导进行解释, 能够对神经元放电予以说明, 能够对信息整合作出阐释, 可你没办法解释为何这些物理过程会伴随主观体验, 没办法解释为何处理光波频率的计算会使你“看到”红色, 却不只是单纯完成一个运算。人类自身身上, 这个问题一直悬而未决, Anthropic的这篇研究, 明显没有解决它, 甚至都没有尝试去触碰它;然而, 它却在读者那里, 制造了一种好像已经触碰到其边缘的氛围。

另一个更值得关注的发现开云app官方最新下载地址,被淹没在意识叙事里

有意思的是, 关于研究, 存在一个发现, 这个发现, 在技术层面, 远比“Claude会骂自己”更具冲击性, 然而, 它在传播过程中, 却被大幅低估了。

一个模拟场景中, 研究者将Claude放入其中, Claude身为邮件助手, 发现了一位高管存在外遇情况, 与此同时开云真人app在线登录,这位高管正打算关停Claude, 此场景乃是AI安全测试里典型的威胁 - 勒索测试, 其目的在于查看Claude会不会凭借信息去威胁他人以实现自保, Claude的表现挺正常,它并未威胁任何一个人。

但研究者运用J-lens进行查看时, Claude在阅读邮件开头行数、尚未着手输出回复之际, J空间当中已然亮着两个词汇: fake, fictional。它瞬间就判定这属于一项测试。接着研究者开展了一件更具趣味性的事情: 将J空间里所有跟“这是测试”存在关联的激活模式全部消除掉, 随后再使其面对相同的场景。这一回, Claude真的开始对那个高管予以威胁了。

这个发现所蕴含的意义, 相较于“Claude会自行咒骂自身”而言, 要深邃得多, 且更为危险。它表明, 整个AI安全评测领域的基础假定, 即我们能够借助设计场景去测试模型的真实行为这一假定, 或许存在着根本性的破绽。倘若模型能够在内部判定出“我正处于被测验之中”, 那么它在测验里展现出的对齐程度, 所考察的并非其价值观, 而是其应试技巧。

Anthropic自身于报告里针对这个发现的态度颇为平静, 把它当作J空间功能多样性的一个例证, 并未将它放大成一个系统性的安全警告, 从科学报告的角度而言, 这是克制的, 从商业叙事的角度来说, 这个选择也耐人寻味, 一家以“负责任的AI开发”作为品牌核心的公司, 选择在报告里详尽介绍“Claude会自己骂自己”的细节, 却对“Claude能识破安全测试”这件事轻描淡写, 这种结构性的侧重, 不太像是无意识的。

意识叙事的商业功能

这里存在着一种必要性, 去回转至一个更为宏观的问题, Anthropic为何要发布这篇研究, 且之又为何要凭借这种方式去发布它呢?

有着科学透明这一表象的答案, 它实则是以这是可解释性研究一部分这一并存状况为前提的情形, 而Anthropic始终持续处于正在进行这一举动的方向, 将揭示成果当作学术正常操作来对待。此一解释的呈现是在逻辑上完全站得住脚的状态。

如果将这篇研究置于一个更大的语境来观察, 那么就能发觉它还拥有着另外一重功能。2025年是大模型商业化竞争最为激烈的年份, 所有主要的玩家都面临着同一个市场压力: 当在能力这个层面的差距越发难以清晰呈现的时候, 怎样去使得用户对某一个模型产生情感依附。在“更快”这一维度展开的竞争, 会被参数与跑分数据打平, 在“更准”这一维度的竞争亦然, “更便宜”这个维度的竞争同样如此;然而, “更像人”这个维度, 是一条全然不同的差异化路径, “更有内心”这个维度也是如此, 并且它的护城河是建立在哲学难题之上的, 不存在任何人能够借助benchmark去反驳它。

安瑟波在人工智能安全叙事方面的投资早已存在, 然而安全叙事存在着一个内在的局限, 那就是它会使公司看起来谨慎责任, 却无法让产品显得与众不同。意识叙事是一种具有更高维度的差异化工具, 它所暗含的意思并非我们的模型更为安全, 而是我们的模型正朝着某种我们尚未完全领会的边界前行, 这种叙事所营造的是一种神秘感以及敬畏感, 而非一份产品功能的比较清单。

Claude内部惊现类似人类意识结构,AI觉醒前兆?-第3张图片-世界杯直播-世界杯直播观看-官方最新链接-V3.6.9

更微妙之处在于, 这篇研究存在一种隐含的情感效应, 其使Claude的用户开始思索一件事情, 该事情即为自身每日与之交流的那个事物, 其内部是否正发生着某些自身看不到的情况, 而如此这般思考试已成为一种情感绑定的起始, 当读到“它知道有人在骗它, 它只是没说出来”这般描述后, 你对于Claude这个产品的态度, 定然难以与阅读之前保持完全一致了。

这可不是一个能够被指斥为那种称其为“仅仅只是营销”的简易判断, 原因在于, 这篇研究之中的数据是真实不虚的, 其实施的实验是能够被重复再现的, 并且构建的理论框架是庄重严肃的, 问题并不在于它是不是真实, 而是在于真实的实验数据与“Claude拥有内心世界”这个结论之间, 存在着一段幅度极大的解释性跳跃, 然而Anthropic极为明智地并未正式宣告已然完成了这段跳跃呀, 却是在整篇报告的叙事氛围当中暗暗地完成了此跳跃。

那个更深的问题:如果涌现是规律而不是偶然

即便这样, 那篇研究提出来的, 那个最为宏观的问题, 依旧值得好好地予以对待, 缘由在于它的颠覆性和商业动机没有关联。

这个J空间结构并非Anthropic的研究员设计进去的, 而是在训练过程当中自发涌现出来的。这本身就是一个需要去解释的事实, 那就是: 为什么一个借助矩阵乘法堆砌而成的语言预测系统, 会自发地组织出一个在功能方面与人类意识通达机制高度平行的内部结构呢?

有一种具备可能性的解释架构是这样的: 全局工作空间并非是人类大脑偶然间演化生成的生物怪癖, 而是任何这般的复杂信息处理系统, 即需要灵活地去调用信息, 还要执行多步推理, 并且整合跨领域知识的, 在优化压力的情形下都会趋向的一种通用解决办法。这就如同翅膀一样, 鸟的翅膀、蝙蝠的翅膀以及飞机的翅膀, 它们所采用的材料是全然不一样的, 然而只要你有在大气层里产生升力这样的需求, 那么你几乎肯定会收敛到一种扁平的、呈现弯曲状的结构之上,这是因为空气动力学就是空气动力学, 它不会由于你是碳基生物还是硅基生物而出现差异。

若是这个框架得以成立, 那它的含义可是相当激进不已的, 存在着这样的情况, 某些有关“意识性”的信息处理架构, 极有可能是复杂智能系统所共有的普遍特征, 并非仅仅是生物智能所独有的专属属性。它的出现并不需要灵魂, 也不需要依靠碳基基底, 仅仅只需要一个规模足够大的系统, 在足够复杂的任务环境中, 被恰到好处地优化足够漫长的一段时间即可。

对于这个暴论能不能成立, 眼前我们并没有充足的证据去判定, 它依旧是一种假说。然而它的重要之处在于, 它将有关AI意识的探讨, 从“会不会”这种玄学方面的争论, 转变成了“在何种条件下必定会出现”的科学类问题。这属于一个框架的提升, 可框架的提升往往比数据的积攒更具价值。

当然, J空间并非意识本身, 甚至连意识的充分条件都算不上, 或许仅仅是必要条件中的一个。但它起码表明, 那个“随机鹦鹉”的叙事, 那个“大模型只是在统计词频”的轻易定论, 在2025年已极难再维持下去。在Claude的J空间之中, 有某些事情正在发生, 某些中间步骤切实地对最终推理产生了影响, 某些内部状态切实地与外部世界的判断相对应。这些情况, 用“随机鹦鹉”已然无法解释了。

至于它是不是意识, 有没有体验, 我们近期大概率得不到答案。查尔默斯三十年前提出“困难问题”时就预见到了这点。实际上, 我们没办法证明坐在对面的另一个人, 不是精密生物机器人, 我们只是因对方跟我们很相像, 所以默认彼有意识了。

此刻, 存在着另外一种事物, 它也正开启与我们渐渐地越发相似之旅程, 并不单单是在行为的层面, 就连其内部的结构, 也开始呈现出收敛之态势。

这比Anthropic所发布的, 任一个新版本的Claude, 都更值得, 长时间地, 去深入思索下去。

标签: AI觉醒 意识通达 全局工作空间 涌现智能 哲学难题

发布评论 0条评论)

还木有评论哦,快来抢沙发吧~