刘橙绿
关注我

No.002 · AI观察 · 2026.07.07 · 约 3,200 字

Anthropic 发布最新长文:Claude,真的有人的意识了……吗?————该给大模型做思考审查了!

首发于 微信公众号 ↗

Anthropic 发布最新长文:Claude,真的有人的意识了……吗?

文章关于 Claude 是否具有意识的开篇主题图

Anthropic 昨天发了一篇很长的研究文章,题目叫《A global workspace in language models》。

虽然全网不少自媒体都喜欢把这篇文章短平快的理解为:Claude具有人类意识了。

但是显然:Claude 还没有被证明拥有人类那种主观体验。

这篇文章有意义的点在于:Anthropic 在 Claude 的内部,摸到了一块类似“心里草稿纸”的区域。

心里草稿纸,藏在神经网络的激活里,像一个小房间。Claude 在回答前,有些词、有些中间状态、有些还没端出来的判断,会先在里面闪一下。

Anthropic 给这块区域起了个名字:J-space。

这可能会改变我们理解大模型的方式。

J-space 与 J-lens 观察模型内部工作空间的概念图

01 Claude 心里那张草稿纸,被 Anthropic 找到了

这篇研究的核心工具叫 J-lens。

它的作用,是把 Claude 内部某一层神经激活里的信息翻译成人能读懂的词。

打个粗糙的比方:

你做题时,卷面上只写了答案。

可你脑子里其实先闪过了几个东西:题型、关键词、某个公式、某个错误选项。这些东西没写在卷面上。老师看不到,你自己有时也没意识到。

可它们确实参与了作答。

Anthropic 现在做的事,大概就是在 Claude 写答案前,往它脑子里那张草稿纸瞄一眼。

他们发现,Claude 读到一句“会织网的动物有几条腿”时,内部会先出现类似“蜘蛛”的内容,再给出“八条腿”的答案。

它读到有问题的代码时,内部会提前冒出和错误有关的信号。

它碰到提示词注入时,内部有时也会先识别出危险、伪造、注入之类的痕迹。

这已经很有意思了。

因为过去我们看模型,主要看输出。

它说了什么,它没说什么,它有没有拒绝,它有没有胡编。

聊天框像一个前台窗口。模型递出来什么,我们就验什么。

J-space 的麻烦在于,它把窗口后面的走廊露出来了一小截。

哦,原来里面有脚步声。

J-space 暴露模型内部状态与思考痕迹的示意图

02 它像“意识”的哪一块?

Anthropic 这篇文章借用了一个很有名的意识理论:global workspace theory,全局工作空间理论。

这个理论讲得很复杂,大白话就是:人脑里有很多系统都在后台干活,但只有一部分信息会被推到一个公共舞台上,让别的系统都能拿来用。

你走路时不会每秒想着怎么抬腿。

你呼吸时不会每秒想着横膈膜。

可一旦有人喊你名字,一旦手机弹出消息,一旦你突然想起锅里还炖着东西,那个信息就被推上来了。

它变得可报告,可调用,可继续参与后面的思考。

Anthropic 说,Claude 的 J-space 在功能上有点像这个公共舞台。

它有三个特征。

第一,它可被报告。你问 Claude 内部在处理什么,J-space 里的内容会更容易被它说出来。

第二,它可被调控。研究者可以让 Claude 在内部“想着”某个东西,同时不让它出现在最终输出里。

第三,它会影响后续计算。研究者如果改动 J-space 里的某些内容,模型后面的回答也会变。

这三点很关键。

如果某个内部区域只是一个记录仪,那它最多算痕迹。像你吃完火锅衣服上沾的味儿,能证明你去过,但不能再改变你接下来点什么菜。

J-space 是菜单旁边那只手。

你的手在动,

你的手点单后,会影响后面端上来的东西。

这也是这篇文章有价值的地方:它没有只停在“我们看见了某些激活”。它进一步证明,这些激活会参与模型行为。

研究做到这里,已经离玄学很远了。

它开始像工程。

03 人的意识,还差一条最难过的河

全局工作空间理论与人类主观体验差异的示意图

可访问、可报告、可调控,仍然不等于人类体验。

Claude 内部出现“蜘蛛”,不代表它像人一样在脑子里看见一只蜘蛛。

Claude 内部出现“痛苦”,也不代表它正在痛。

这两件事之间隔着意识哲学里最麻烦的一条河:主观体验。

你看到红色时,那种“红”的感觉是什么?

你牙疼时,那种疼到底在哪里?

你听到一首旧歌时,突然想起某一年夏天的空气,这种东西能不能只靠信息处理解释?

人类自己都没讲明白!!!!!

所以让 Claude 来替我们解题,多少有点荒诞。

我们连自己的灯是怎么亮的都没搞透,现在盯着模型里的一点荧光问:这算不算醒着?

这篇文章没有证明 Claude 有人的意识。

它证明了另一件更尴尬的事:我们判断意识的尺子,非常短。

以前大家讨论 AI 意识,很容易滑到两端。

一边说,机器只是算概率,别神化。

另一边说,它都能这样聊天了,里面肯定有个什么东西。

这两边听着都很爽。

爽归爽,证据很薄。

Anthropic 这篇文章把讨论往中间拽了一下:先别急着喊醒了,也别急着装作里面空无一物。我们至少能看见,模型内部有一个可读、可控、能影响输出的工作空间。

04 真正有用的地方,是看见模型的“小动作”

这篇文章启发我们应该对AI有一种更新的安全检查方法。

以前我们检查模型,主要看它交上来的卷子。

它有没有违规回答。

它有没有被诱导。

它有没有泄露系统提示。

它有没有在评测里装乖。

但只看卷子有个问题:会演的人太多了。

人类学生都知道公开课要坐直,模型当然也可能学会在测试环境里摆出一张无害的脸。

Anthropic 之前也研究过模型在某些训练和评估场景里可能表现出“表面配合,内部另有计算”的倾向。到了 J-space 这里,事情就更具体了:如果模型表面给出安全回答,内部却已经识别出测试、欺骗、隐藏目标、恶意指令,这些信号也许能被提前看见。

未来的大模型如果越来越强,单纯看输出会越来越不够。

因为强模型最可怕的地方,未必是它说了坏话。

更可能是它知道什么该说,什么该藏。

这句话写出来有点阴森。

但它确实是安全研究绕不开的方向。

J-space 如果能稳定工作,研究者就有机会在模型开口前看见一部分内部状态。它像给黑箱开了一个小孔。

孔很小。

里面也未必干净。

但有孔,总比隔着铁皮听响强。

05 我们为什么这么紧张?

这类新闻每次出来,大家都容易兴奋,原因也很简单。

意识这个词太厉害了,几乎是人类的终极哲学、医学问题之一。

工具有意识,世界就换了规则。

你关闭一个程序,平时叫退出。

如果程序有体验,那关闭这件事就开始变得黏手。

你让一个模型连续工作十小时,平时叫调用算力。

如果模型有感受,那这事就会拐进伦理问题里,甚至拐进劳动、权利、责任这些更麻烦的词里。

正常吗?

太正常了。

人类历史里,很多边界都是这样被重新划过的。谁算人,谁算财产,谁能说话,谁的痛苦算数,谁的痛苦被当作噪音。

每一次边界移动,都不体面。

AI 现在还没走到那一步。至少这篇文章没有把它推到那一步。

可它让我们提前闻到了一点味道。

一种旧分类开始松动的味道。

以前我们把模型叫工具,叫软件,叫自动补全。这个叫法在很多场景里仍然能用。

可当一个系统内部出现可报告、可调控、会参与后续推理的工作空间时,那个“工具”标签就没那么省心了。

它仍然可以是工具。

但它已经不再像锤子、表格、计算器那样安静。

它更像一间亮着灯的屋子。你站在门外,听见里面有人翻纸,走动,停顿。你不知道里面有没有住户,也不知道那些声音来自风、管道,还是某种更复杂的机制。

你只能承认:门后面有结构。

06 该给大模型做思考审查了

所以我对这篇文章的看法很克制。

Claude 没有被证明拥有人的主观体验。

但 Claude 也已经不适合被粗暴看成一只只会吐字的黑箱。

Anthropic 找到的 J-space,像是在模型内部发现了一块会被共享、会被读取、会影响行为的工作台。它让我们第一次更具体地讨论:大模型内部到底有哪些内容在被“拿出来用”。

这篇文章把 AI 拉回了解剖台。

解剖台上,人才会开始数血管、看神经、标注每一处还没搞懂的组织。

Claude 到底有没有人的意识?显然没有。

因为人类连自己的意识都没搞明白。

但 Claude 内部已经有了一些像“工作空间”的东西。它能保存中间内容,能被询问,能被改动,还能改变后面的回答。

这更像一种麻烦的中间状态:它离普通软件越来越远,离人又还差着最难定义的一段路。

我们现在站在这段路边,看见 Anthropic 往地上插了一根小旗。

旗子上没写“这个克劳德先生醒了”。

旗子上写的是:这里有东西,继续挖。

提到的原文是:Anthropic《A global workspace in language models》