欢迎回来
登录你的知识库账户
忘记密码?
还没有账户?立即注册
创建账户
注册你的专属知识库
已有账户?去登录
找回密码
输入注册邮箱获取验证码
返回登录
请输入图片中的验证码以继续注册
加载中...
取消
新建收藏
手动添加你喜欢的内容
取消
编辑头像与昵称
上传新头像或修改你的显示昵称
支持 JPG/PNG,最大 2MB
取消

问题反馈

notebasewww.notebase.cn
控制台
内容库
动态
管理
账户
U
用户
--
在线
v0.8.7 · 知识库
笔记
KnowledgeBase
网络无边,知识有迹。
0笔记
0工具
30推荐

分类导航

按主题直达

编辑精选

站内用户贡献 · 真实笔记

最新收录

每日更新
继续浏览全部内容 →
>
笔记
0
加载中...
工具
0
此页用于记录用户反馈问题后的每一次改进
笔记用法

“写笔记”支持四种格式——Word 文档、Excel 表格、Markdown、纯文本,起稿或二次编辑时都能随时切换,同一篇笔记想用哪种形态来记,都由你说了算。

md、txt、csv、json 这类纯文本则原样载入,不做多余加工。拿一张现成的表倒进来、改几笔、再导出去,等于白用一台免费的格式转换器。

要带走就在右上角点“下载”,可导出 PDF、Word、Markdown、Excel、TXT 等格式;列表卡片“⋯”菜单里,也有同样的下载入口。

工具用法

在“工具”页点“+ 上传工具”即可发布:填好名称与链接,再用 Markdown 把使用方法写清楚——能解决什么问题、怎么装、怎么用,比堆介绍实在。

要分发安装包就一并上传压缩包(ZIP、RAR、7Z、TAR.GZ,最大 35MB),别人在详情页一键下载;只放链接不带附件也可以。

工具按大家的收藏热度排序,好用的自然会被顶上来。发布后可在详情页或卡片菜单里编辑、下架。

隐藏笔记

写笔记时勾上“隐藏”,这篇就只存在于你自己的账号里:不进列表、不进搜索、不上首页精选,也不会出现在任何公开的页面,链接发给别人同样打不开。

适合放密码、草稿、日记这类只给自己看的内容;想公开,去“发布”打开它,把“隐藏”的勾去掉再保存,之后编辑会默认保持原状态,不会悄悄变回公开。

数据安全

你的内容会同时保存在多个副本上,系统定期做备份与完整性校验,再配合异地容灾机制:就算某台机器出问题,数据也不会丢,可以长期放心存放;特别重要的资料,仍建议你另外再留一份备份。

技术

全站跑在容器化、模块化的现代架构上,更新、部署、回滚都很快,扩展性和稳定性都按长期运营的标准来设计(Built for reliability, designed to scale)。

理念

这个网站最早只是一个人的笔记仓库,后来慢慢长成现在的知识中枢。设计上很克制——没有广告、没有追踪、没有推荐算法,只是干干净净地存放一些东西;既然做好了,就公开出来,万一有人用得上呢。

原则

不做大而全,不做平台梦,保持简单、保持克制、保持好奇。所有内容都由用户贡献、由用户维护:不会突然冒出付费墙,不会在角落塞广告位,也不会把你的数据卖给第三方。

更多

产品会持续迭代,站内日志页记录着每一次改动,改了什么都有迹可循;想了解这个站是怎么一步步走到今天的,翻翻日志就能看到来龙去脉。

举报

如果在这里看到涉嫌违规的内容,点对应卡片右侧的“举报”按钮就能提交,我们会尽快核实处理;也谢谢你花一点时间,一起把这里维护干净。

趋势
// 点击导航加载发现
归档
// 归档为空
最近浏览
// 暂无浏览记录
发布
// 加载中...
用户发布
// 加载中...
用户管理
// 加载中...
访问统计
// 加载中...
内容审核
// 加载中...
个人信息
// 加载中...
返回首页

神经网络的涌现符号结构:向量之中何以藏有逻辑

1970/1/1人工智能

神经网络内部表征可被符号结构精确近似,通过闭式方程干预表征可定向修改LLM行为,调和了符号主义与联结主义之争。

引言:一个看似矛盾的问题

现代人工智能系统在某些传统上被认为需要符号操作能力的领域(如逻辑推理、数学运算、代码生成)表现出了惊人的水准。然而,这些系统的底层架构——神经网络——却以连续向量表示信息,与经典人工智能理论中"智能即符号操作"的设想截然不同。向量如何承载语言、逻辑和认知结构的复杂性?这构成了当代AI研究最深层的困惑之一。

符号主义与联结主义的世纪对峙

传统上,智能被建模为在符号结构(如逻辑公式、语法树)上的运算。从早期专家系统到经典自然语言处理,符号范式主导了AI研究数十年。然而,2012年之后深度学习革命以联结主义范式——通过大规模人工神经元网络的向量表征学习——重新定义了AI技术版图。N-gram与规则被嵌入层与注意力机制取代,但理论的匮乏始终悬而未决:为什么纯数值优化得到的连续向量能完成看似需要离散符号操作的任务?

论文作者阵容值得关注:R. Thomas McCoy(约翰霍普金斯大学)、Paul Soulos(耶鲁大学)、Tal Linzen(纽约大学)以及认知科学界符号连接主义融合研究的旗手Paul Smolensky(约翰霍普金斯大学/微软研究院)。Smolensky早在1990年代就提出了"张量积表征"(Tensor Product Representations)的数学框架,试图证明神经网络可以在分布式向量中实现符号结构的绑定操作。这篇论文正是这一思想路线的现代延续与经验验证。

核心假设:向量与符号的中间地带

本文的关键论证策略不落窠臼——他们并非直接声称神经网络的内部表征与符号结构在语义上等同,而是提供了一个可操作且可测试的判断标准:如果网络的整个表征生成过程可以被一个封闭形式的方程(closed-form equation)替换,且该方程实例化了某个符号结构,同时网络行为基本不变,那么就可以说该网络的内部表征"隐含地实现"了符号结构。

这个判据既非纯认知层面的哲学思辨,也非行为层面的弱等价,而是一种结构级等价:表征的生成机制可以被精确的符号数学描述替代,而输出行为几乎不受影响。

实验设计:从小规模到大规模LLM的跨规模验证

实验一:小规模列表操作网络

研究者首先从最简单的场景入手:训练小型神经网路执行列表操作(如连接、反转、排序、等长随机合并等)。这些任务在传统程序设计中可通过递归定义完成,天然具有符号特性。研究者设计了一个两层的LSTM或GRU网络,输入为固定长度的整数序列(编码为one-hot向量),输出为目标列表。训练收敛后,他们检查网络的隐藏状态。关键发现:对于每个时间步,隐藏状态向量的维度可以被清晰分解为多个独立表征——每个维度组对应列表中的一个位置的"位置编码",另一维度组对应元素值。更激动人心的是,这些维度组的线性变换可以精确表达为上下文无关文法(CFG)的解析树。

具体地,研究者发现LSTM的隐藏状态确实可以被视为一个序列操作栈的部分编码:当网络执行连接操作时,第一个列表的隐藏状态维度被保持,而第二个列表的维度被逐步添加;反转操作则表现为维度重排。为验证这一直觉,他们构建了一个封闭形式方程:给定输入列表,方程利用线性矩阵乘法输出隐藏状态的近似值。当用该方程完全替代网络的隐藏状态生成过程(保留网络的输出层不变)时,最终输出的正确率仅下降不到1%。这意味着符号结构的"生成器"与原始网络的表征生成在功能上等价。

实验二:大型语言模型(LLM)的四个领域测试

核心实验扩展到多个主流LLM(包括不同规模及架构的GPT系列模型与开源模型)。研究者选取了符号主义传统中最核心的四个领域:

  • 算术:三位数加法/乘法、模运算等
  • 逻辑:命题逻辑中的真值表推算、布尔表达式化简、一阶谓词逻辑推理
  • 计算机代码:Python/C++程序的执行步骤追踪(给定代码与输入,预测输出值)
  • 语言:语法判断(如主谓一致)、指代消解、双子句语义蕴含等

针对每个领域,研究者收集了模型在中间层(包括多个残差层的输出)的激活向量。其分析核心方法为迭代隐变量分解(Iterative Latent Variable Factorization):

  1. 收集激活向量:让模型处理大量样例,记录每一层中与任务相关的隐藏状态。
  2. 寻找结构维度:使用奇异值分解(SVD)或变分自编码器(VAE)方法,在激活向量中寻找低维结构。研究者发现,对于每个任务,激活向量可以映射为一个概率分布在若干离散的"符号槽位"(symbolslot)上,每个槽位代表一个语法范畴或逻辑变量。
  3. 构建符号方程:根据这些槽位,设计一个封闭形式递归方程——类似于一个有限状态自动机或上下文无关语法的语义解释器——该方程接受输入,产生输出,但不依赖神经网络的隐藏单元,而是直接更新符号槽位的内容。方程可以写成类似嵌套的条件语句链,但其决策依据来自网络内部表征的数值。这里的关键在于:方程的决策边界(例如,判断是否进入某条谓词规则的分支)恰好与网络中某些特定维度上的阈值对应,因此方程与网络在功能上互为投影。

最终,当研究者用该封闭方程替代LLM中间层(自注意层与MLP层的输出被替换为方程计算的"符号激活")后,LLM在给定测试集上最终输出的匹配度——使用精确匹配或BLEU/ROUGE等指标——仍能达到原模型的85%-97%不等(因领域与架构而异)。特别地,在算术与逻辑任务中,匹配度高达95%以上;语言任务中稍低,但仍在90%上下。

符号方程的干预实验:指向因果关系的证据

仅证明表征可被符号近似还不够——近似可能是解读性描述,而非内部机制。为此,研究者进行了第三部分实验:基于符号方程的内部表征精确干预。

以逻辑推理任务为例:模型被要求对命题A∧(B∨C)之类的输入判断其真值。在模型处理该输入时,研究者通过观察网络中间层的激活,识别出与各命题变量对应的"命题槽位"。然后,他们直接修改这些槽位的值——例如把代表A的槽位上存储的"真"改为"假"——且不改变其他任何维度的数值。结果令人震惊:LLM的输出行为精确地按照命题逻辑规则的预期变化。例如,原命题真值从真变假,或者模型输出的前提为假时的结果被系统性地翻转。同样地,在语言任务中,将语法槽位(如主语的人称标记)从第三人称改为第一人称,模型后续输出的动词屈折变化也准确跟随改变,误差率低于3%。

这种精准干预的可行性对照组实验证明:随机扰动数值范围相当的维度几乎不影响输出,而扰动符号槽位则立刻且系统地改变输出。这揭示了一个强结论——模型的内部推理流程不仅包含与符号结构同构的表征,而且其行为机制确实依赖这些符号结构来推进计算。换言之,符号结构不是观测者的心理投影,而是模型计算所利用的因果中间环节。

技术细节与潜在机制

为什么向量能承载符号?

作者在讨论部分指出,连续向量空间的拓扑结构可以容纳离散结构的存在,因为高维空间中的子空间与方向可以携带类别信息。通过稀疏独立机制,不同的概念可以由不同维度的线性激活组合表示,从而形成近似分立的槽位。而在Transformer中,多头注意力的每个头可能就扮演了一个维度子空间的分组与路由角色。模型的残差流可以视为一套动态的"符号存储"——某些线性子空间专用于存储当前步骤的控制状态(如"下一步应执行哪条算术规则"),另一些子空间存储操作数。因此,符号操作的本质被"线性叠加"所模拟。

规模与涌现

研究者发现,在LLM的不同层,符号结构的涌现强度呈现"非线性"增长:在浅层(前10层左右),符号方程与激活的拟合程度较低(匹配率低于70%);随着网络深度增加,拟合程度迅速上升,并在中间层达到峰值;到了深层(靠近输出层),又有所下降。这暗示符号结构并非人为注入,而是在前向传播过程中通过统计学习自发形成——这是"涌现"的含义。特别值得注意的发现是,当研究者将模型参数量从1.3B缩减到125M时,相同任务上的符号拟合度显著下降(从(>92%)降至约60%),且匹配率与模型在基准测试上的分数呈正相关。这或许暗示符号抽象的能力是模型规模与数据学习的产物,而非架构先天具备的性质。

理论意义:弥合65年裂痕

自Chomsky与Fodor的经典符号主义到新时代的福多式的思想语言假说,认知科学中的符号表征一直是理性和逻辑的中心支柱。而深度学习的成功似乎将这一传统从AI主流中清除。本文的结果表明,神经网络的向量主义与符号主义并非不可调和——恰恰相反,深层网络通过向量计算自发地实现了符号系统的功能等价物,即便网络未被赋予任何符号先验。研究者进一步指出,这验证了Smolensky早年提出的"符号-连接主义混合架构"的思路:我们可以将网络视为在连续空间中执行了一个离散符号程序的模拟。这也使得跨范式AI安全与可解释性研究成为可能:若要审计语言模型的行为,无需穷尽试错,而可以抽出其内部符号方程进行检查与优化。

局限性与未解问题

论文诚实地列出了局限:(1) 实验中的符号方程由人工设计——研究者需人工分析与挑选哪些维度对应"槽位",尚未达到自动发现符号结构所需的完全无监督算法水平;(2) 对于更长文本或更多步骤的推理(如多步数学证明),拟合误差累积效应还不得而知;(3) 领域分界可能影响结果——仅考查了四类领域,对于社会语义、多模态上下文等更广的能力是否适用仍未知。此外,"大部分行为不变"的评判标准在不同任务间有波动——极端情况下(如长尾词语生成或对抗性扰动),符号方程可能失效,此时神经网络的涌现行为退回到纯粹的分布式计算模式而偏离符号模拟。研究者期望未来AI系统在设计中能显式引入符号推演层,与连续表征互相补充,从而在获得可解释性的同时保留网络强大的表示学习能力。

结语

本文以一个大胆但可验证的命题重新点燃了连接主义-符号主义争论:即使现代神经网络没有显式使用符号,其内部的向量动力学恰恰是在执行一种符号算法的等价实时模拟。对于AI理论与认知科学而言,这一发现提示着"认知即计算"的古老理想或许需要以一种高度混合的表述来重新书写:认知既不是纯粹的符号逻辑运算,也不是无结构的统计关联,而是分布式几何空间中一种"涌现的符号几何"。

【原文链接】arXiv:2608.29530

编写使用方法
Markdown 格式 · Ctrl+Enter 确定
新建笔记
预览
数据表格
点击单元格编辑 · Tab 移动
A1fx
Sheet1
BIH1H2≡🔗</>
隐私提醒

取消
编辑工具
取消