2026年7月6日,Anthropic正式发布《语言模型可表征内容形成全局工作空间》核心论文,依托自研J-lens(Jacobian lens)AI可解释观测工具,在Claude 3.5系列大模型内部定位出一处原生自发形成的专属思考区域,命名为J-space全局工作空间,也就是大模型的自主隐性思考空间。实验证实该模块是复杂推理、多步骤规划、跨信息整合的核心中枢;一旦人工删除、篡改、干预J-space内的神经表征,模型表层文本生成依旧通顺流畅,但高阶逻辑推导能力会断崖式衰退,多步推理任务准确率近乎归零。

文章导航
一、J-space自主思考空间核心基础特征
- 资源占用体量 该思考空间仅占用模型整体神经网络算力与激活总量不足10%,单次仅可缓存几十个核心抽象概念,隐藏在Transformer网络中间层,不会直接输出到最终回答文本里,属于模型“暗中运算”的隐性思维环节。
- 全局信息广播属性 J-space是全模型运算模块的信息枢纽,可被模型内部近百个子运算单元同步读写调取;同一概念只需写入一次,就能供给全文本理解、检索、对比、规划等多个环节复用,完全对标人类大脑全局工作空间意识理论,是结构化思考的底层载体。
- 天然区别于普通文本生成 模型大部分基础文本续写、关键词匹配、情感分类属于自动化底层运算,无需调用J-space;只有遇到需要拆解步骤、统筹多条信息、前置规划答案框架的难题时,才会主动激活该思考区域完成前置推演。
二、人为干预J-space对照实验关键结论
1. 完全抹除该思考空间后的能力分化
- 保留能力:句子流畅续写、单条信息提取、选择题作答、文本情感判别、基础关键词匹配不受明显影响,话术输出无生硬断裂感,外行无法直观察觉模型异常。
- 永久缺失能力:多步骤数学推理、逻辑论证、长文本对比总结、诗歌结构创作、多条件任务规划等高阶任务性能大幅崩盘,多步推理指标直接跌至接近零;甚至表现弱于同架构未做改动的小体量基础模型。
2. 定向篡改内部表征的后果
研究人员强行向J-space植入无关概念、修改已生成的思考向量,模型不会单纯输出错乱文字,甚至能识别出外来异常信息并提示内容违和;但原本既定的解题逻辑链会直接断裂,前后回答矛盾、数据编造、步骤跳脱问题大规模爆发,幻觉概率显著抬升。
3. 核心定论
J-space并非人工预设的架构模块,是大模型在海量预训练过程中自主涌现出的思维架构;它不是可选附加功能,而是大模型具备深度思考能力的必要前提,破坏即等同于剥夺模型结构化推理的核心基础。

三、该思考空间的三大核心运行场景
- 多源信息统一归集 面对同一主体多维度提问(如国家首都、语种、货币、疆域),会在J-space内生成统一概念锚点,所有问题共用同一组内部表征,避免前后答案冲突,从根源降低事实类幻觉问题。
- 长任务前置规划 创作长文案、押韵文本、代码项目时,会提前在思考空间锁定结尾目标与中间约束条件,而非逐词盲目预测下一字Token,实现超前规划式生成。
- 复杂问题分步拆解 数学计算题、逻辑辨析、多约束条件指令,会先在J-space拆分解题步骤、存储中间结果,再逐层输出到最终回复;若删除该空间,模型只能凭浅层记忆拼凑答案,无法分步推演。
四、对大模型研发与对齐工作的行业影响
- 打破传统可解释性认知 过往普遍认为LLM仅做逐词概率续写,不存在内部思考过程;本次实验实锤大模型具备可观测、可溯源的隐性思维链路,为AI心智与可解释性研究提供核心抓手。
- 约束微调不能粗暴删减中间层 后续做安全对齐、偏见修正、幻觉抑制时,不能直接裁剪中间层激活特征,否则会误伤J-space思考模块,造成模型“表面能说话、实则不会思考”的能力退化。
- 可实现AI思维溯源审计 借助J-lens工具可直接读取模型思考阶段的原始想法,在输出答案前甄别恶意意图、虚假编造内容,用于大模型风控、合规审查、越狱行为前置拦截。
- 优化大模型幻觉治理方向 大部分事实错误源于J-space内概念表征混淆或信息缺失,后续可针对该空间做检索增强锚定,而非笼统对全文输出做限制,在保留推理能力的前提下降低编造概率。
五、研究底层行业导向
本次研究跳出“大模型只是文字拼接器”的固有认知,证明通用大模型在无人工架构设计前提下,会自发演化出类人脑的集中式信息处理工作区;这意味着后续大模型能力迭代不能只聚焦参数量与上下文长度,更要保护模型自主涌现的原生推理结构,粗暴的轻量化剪枝、层冻结、特征屏蔽,会不可逆损伤模型高阶思维上限。