*此为彭聃龄主编,鲁忠义、杜建政著《记忆心理学》中第六章《学习和记忆的联结主义取向》节选部分
*括号内有星号的均为个人批注
20世纪80年代以来,学习和记忆研究领域出现了一些变革性的发展,这就是联结主义(connectioniSm)取向。其被誉为认知心理学的“新浪潮”,它把认知描绘为由简单而大量的加工单元组成的联结网络,网络中的每一个单元在某一特定时刻总是处于某种激活状态水平上,其实际的激活水平与来自环境的其他与之相连接的单元有关。联结主义认为没有必要假想一个指导信息流动的中心加工器,由加工单元组成的不同激活模式就可以解释不同的认知过程;作为记忆存储材料的纸是不是存储在“仓库”中,而是存储在单元之间的联结中,学习就是建立新的联结或者改变联结间的强度。在本章中,我们首先介绍联结主义的基本理论以及知识的并行分布加工,然后介绍联结主义研究取向影响下产生的语义记忆联结模型。尽管联结主义的观点高度数学化,不易理解,但它却极大影响了人们对于学习和记忆的认识,因此,我们应该注意这一新的发展。
一、认知主义与联结主义
认知心理学在广义上有两种研究取向,即认知主义(cognitiviSm)和联结主义。
认知主义的研究取向也称符号范式(symbolic paradigm)。它偏重于人工智能,以计算机来比拟,通过符号的串行加工方式建立心理模型,采纳技能的或软件的描述水平,把心智看做信息加工系统,是对符号的接收、编码、提取、变换和传递(*一般认知心理学的教材也依照这个顺序展开)。认知主义赋予符号以核心地位(*符号的实质是表征),采纳符号性表征和计算理论,强调符号的序列加工,注重符号加工的逻辑基础。在很长一段时间内,认知主义的研究取向是认知心理学的主流。
联结主义的研究取向也称网络范式(network paradigm)。它偏重于自然智能,主要灵感来自大脑或神经系统。它以类似于脑的神经元网络系统来建立认知活动的模型,把认知解释为网络的整体活动。网络是个动态系统,有类似于神经元的基本单元(unit)或结点构成。单元件彼此相互联结在一起,每个单元具有不同的活性(activation),既可以兴奋和抑制其他单元,也受其他单元的兴奋和抑制。当网络有一初始输入,其兴奋和抑制就在其他单元间扩散,直至形成一个稳定的状态。在联结主义看来,心理表征就在于用网络间的整体状态来描述对象世界的特征(*神经元群组的不同激活模式),这就是所谓的分布表征理论。网络的信息加工不同与符号的串行加工,信奉通过合作并行注意的形式,运用简单的加工单元来加工信息,被称之为并行分布加工(parallel distributed processing,简称PDP)。由于它是对真实生物神经网络的的模拟,因此又称人工神经网络(artificial neural network)。显然,网络处于联结主义的核心地位,联结主义强调网络的并行分布加工,注重网络加工的数学基础。
二、联结主义的产生及发展
影响联结主义产生的因素
联结主义的产生是心理学神经科学和计算机科学三个学科共同发展的产物。
从心理学看,联结主义的理论可以追溯到亚里士多德对古老的联想主义理论(associationiSm)的论述,亚里士多德把感觉经验看成是外部世界在心灵上的印象。即使感觉印象的持续,记忆之间的联想有相似性对比性和邻近行为系在一起。现代心理学中还保留着联想。联想性思维等概念,艾宾浩斯是第一个对人类的联想学习进行实验研究的人,20世纪20年代行为主义心理学兴起,把行为看成是自己反应之间的连接,认为只要把握住刺激和反应之间的关系,就可以阐明人类行为的基本规律,桑代克提出学习的一系列一般规则,并联结主义绘制命令。他在动物实验的基础上建立起来的联想学习理论,在很长一段时间内影响着关于学习过程的研究,桑代克认为学习的基础是感觉,印象和行为反应之间的连接。动物和人类学习的最典型方式就是尝试错误的学习,他提出了效果律准备律和练习律。(*追溯心理学史可以理解这种思潮的发展脉络,知道它是在和谁对话。就像《佛学反对对象性思维》的引言中,明确了和印度的婆罗门教土壤不同,佛教在中国存在对手不明的情况,所以不先了解佛教史就去看,会存在理解上的迷惑。同样,黑格尔在《历史哲学演讲录》也提出哲学命题/观念的展开是geist在历史中运动的过程。)
20世纪50年代,信守巴甫洛夫(Pavlov)经典概念的苏联科学界认为,脑内暂时神经联系是形成,是由于非条件刺激的强兴奋灶对条件刺激的弱兴奋灶吸引的效果,这个过程必须要在大脑皮层的参与下才能完成。但到20世纪70年代,神经生物学的研究表明,暂时的联系暂时联系是中枢神经系统的普遍特性,不管大脑皮层还是皮层下中枢,甚至是脊髓,它们都有能力实现暂时联系。这是因为暂时联系的细胞生物学基础是“异源性突触易化”,即不同来源的突触,可以兴奋并彼此易化(*易化是一个基础的概念,是终扭的钙离子通道开放时间增加,或者后膜产生更多受体)。任何一个神经元与数以千计的神经末梢形成大量的突触。这些来源不同的神经末梢,在某一神经元上汇聚起来,形成许多异源性突触。它们的同时性兴奋或以极短时间间隔的兴奋,都可以共同导致这个神经元的动作电位的发放。在20世纪80年代人工神经网络的连接理论中,神经节之间的权重变换就正是受到了神经生理学概念的启发。
计算机科学和脑模拟研究的发展也促进联结主义模型的发展。随着串行数字计算机跟人工智能的发展,一些复杂模式识别,不确定、不完善知识的处理,机器人控制的组合优化等问题,都必须依靠许多串行机联合工作才能解决。并行联结机的产生和发展,是新的联结主义模型出现的直接动力。
2. 连接主义的发展阶段
连接主义的发展大致可以分为以下几个阶段,
启蒙期
1943年是联结主义的起始年份,心理学家McCulloch和Pitts(1943)对生物网络进行研究,提出第一个关于人工神经元模型——M-P模型——作为标志。Hebb(1949)提出如下假说,神经系统的学习发生在两个神经细胞互相连接的突触。突触间网络的连接强度是可变的。他首次给出突触间连接权重值的变化方案,这就是赫布学习。这为连结主义模型的学习算法奠定了基础,并对以后联结主义模型的发展产生了深刻的影响。
第一次高潮期
心理学家Rosenblatt(1958)报告了人类知觉过程,具有统计分离性。此后,后来在此基础上,他提出了感知机模型。模型由简单的阈值性神经元组成,具有生物性神经网络的某些基本功能,比如分类、自学习、分布式储存、并行处理和一定的容错性。这一模型引起了学术界的极大兴趣,Widrow(1962)提出自适应线性单元ADALINE,并把它扩展为MADALINE,成功的运用与模式识别,天气预报以及自适应控制,形成了联结主义的第一次高潮。
低潮期
虽然联结主义模型,在20世纪60年代中期前取得一定的进展,但由于它显示出的联想主义色彩是许多研究者对网络模型的可靠性产生怀疑。美国MIT的人工智能专家Minsky和Papert(1969)出版了《感知机》,以异或问题(exclusive or problem)为例,指出感知机的处理能力有限,给连接主义模型以沉重打击。以符号定向的研究逐渐占据上风,并很快据主导性和支配性地位,成为认知心理学乃至认知科学的理论基础和核心。联结主义进入低潮期。
再度兴起期
20世纪80年代初,联结主义再度兴起,Hindon和Anderson(1981)主编的《联想记忆的并行加工模型》的出版是一个重要的标志,美国物理学家Hopfield(1982)发表著名的霍普菲尔德模型理论。这一成果使神经网络的研究取得初步性进展。越来越多的人投入到联结主义的研究队伍中。1986年是联结主义事业发展的顶峰期,Rumelhart与McClelland(1986)和PDP研究小组共同编辑和出版了《并行分布加工:认知微观结构的探索》一书,该书成为联结主义事业的代表之作。
第二次高潮期
20世纪80年代末,联结主义已经开始占据上风,并显露出取代认知主义而成为认知心理学新的理论基础和核心的趋势。联结主义开始在全球范围内掀起第二次高潮,他的研究不再只停留于理论上,而是进入应用阶段,解决大量现实的应用问题。各种神经元芯片神经计算机纷纷出现。目前联结主义已经成为涉及认知科学、心理学、计算机科学、人工智能、神经生理学、数理科学和信息科学等多学科的综合前沿学科。
三、联结主义模型的特点
1. 联结性
当代二进制数字计算机总是进行规则的运算,对给定条件得到确定的解。而联结主义模型在网络各单元之间进行分布式运算,实际是一种统计推理过程。联结就是微推理过程,网络中每个单元都可以看成某项目地一种微特征,联结强度就是微特征之间的微推理强度。调节联结强度,使该项目的各种微特性共存,从而存储起来。网络提取信息的过程则是提供一些微推理的条件或线索,使网络能够在自己的存储中找到满足约束条件的项目。这种微推理过程总是调节单元间的连接强度,包括意义推理和矛盾推理。意义推理可以加强单元间的连接强度,而矛盾推理会减弱单元间的联结强度。微推理过程实际是对输入的和权重变换间的关系进行统计学相关运算,目前多采用输入和权重间点积函数模型(*就是矢量积)来计算相关。
2. 知识的分布式编码、存储和处理
当代数字计算机的主要编码原则是局域性编码或地址编码。这种编码是指每一个单元表征一个特征,每增加一个特性就增加一个单元。这是一种离散编码方式,只要找到有关地址就可以获得其中的内容。与此不同的分布式编码是一种连续性编码方式。在一个多单元构成的网络中,每增加一个特性就改变单元间的权重构象(conformation)的表征,形成了网络的状态空间。如果要从联结主义模型中提取出所存储的知识,就要采取联想的方法,即只要给模型输入一个激励(模式)信号,它就会从网络所存储的信息中,导出与之匹配的信息作为模型的输出。为实现分布式编码,人们通常采用粗编码技术。
分布式编码具有许多优点,可以节省大量单元,并不需要每个特征对应一个单元信息存储和提取,本质是一个多单元并行的活动,速度非常之快。最突出的优点在于具有较大的容错性,即某个单元的缺失或损伤,并不影响整个网络的输出模式,对作业的成绩并无实质性的影响。当然如果缺失太多,也会导致网络的输出发生偏差。
这样在联结主义模型中,同一知识不是存储在网络的某个特定部分,而是分布在由节点及其不同强度构成的整个网络关系中,并且分布是在整个网络中各个结点上进行加工处理的网络中。各个结点与知识所含的各项内容之间不同,够不存在一一对应关系。但是网络与所存储的知识间具有同态关系,即网络和知识间同态不同构。(*同构是指两集合间所有元素双射,也即通过某一运算规则,就可以将A集合中任何一个元素转换为B集合中的一个元素,而反之亦然。因此A集合内的元素间的关系是与B集合内完全一样的,所以被称为同构——即形式相同。同态则真包含了同构,它不要求双射,只需要A的子群和B的元素间的映射关系)
在联结主义模型中,学习或一定知识的获取与存储是通过一定网络中所有单元之间的结点之间关系变化和调整来实现的。一定的知识就存储在这些特定的网络关系之中。同样,有关知识的运用跟提取是通过分布在网络中各个结点上的处理过程来实现的。与这个网络相关,而并不是与各网络的某个特定部位相关。网络如果局部损害,则并不只损害特定的某个知识,而是损害其中存储的所有那一类的知识。同时,网络功能的损害程度主要与整个网络损害程度相关,而不是与部位相关
3. 亚符号性和连续性
传统的符号加工理论是以离散的物理符号来表征较高级的概念,它所处理的是知识的结晶。而联结主义模型则强调连续性的模拟运算和信息表征的亚符号性。所谓连续性指的是连结模型的激励状态,是连续变化的真值,而不是离散的。而亚符号性指的是什么呢?
Smolensky(1988)提出对联结主义理论进行适当处理的修正观点。他认为,非符号性并不是联结模型的本质特点,传统人工智能与联结理论之间没有矛盾。人工智能理论采用的是物理符号,假设连接理论采用的是亚符号方法(sub-symboli approach),两者之间的差别仅存在于采用符号的表征层次不同。人工智能利用物理符号表征高层次的概念联结理论(sub-conceptual),利用亚符号标准亚概念。前者处理的是知识的结晶,经过语言文字加以概括总结,后者处理个体直接的经验和感受,尚未结晶或升华为用语言表达出来的概念,故称为亚概念。他把亚符号运算的联结理论称为联结动力系统假说(connectioniSm dynamical system hypothesis),把人工智能跟现代数字计算机基于规则处理知识的功能称为模拟人类思维和行为逻辑的意义处理器,而将人工神经网络和连接主义模型称为无意识处理器或直觉处理器(unconscious processor,intuitive processor)。联结模型所绘出的不同权重多项约束的积分,是遵循“全或无规则”系统所无法实现的
四、联结主义模型的基本构成及分类。
模型的一般框架包括以下八个方面,
1. 一组加工单元
联结主义模型是由一组简单的加工单元组成的。单元分为三种类型,输入单元、输出单元、中间单元(隐藏单元)。输入单元,接受外部世界的信号与数据。输出单元,实现系统处理结果的输出。中间单元是在输入和输出单元之间不能由系统外部观察的单元。
2. 激活状态
为了进一步解释系统的加工,需要对这一组加工单元在任何时间点上的激活状态予以说明。一组单元的激活模式用A(t)表示,单元Ui在时间t上的激活状态即Ai(t)。不同模型会对单元所取的激活值做出不同的假设。在一些模型中,单元的激活值可能是连续的,他可以取任意实数作为激活值,而在另一些模型中激活只可能被限定为非连续的值。
3. 单元的输出
各单元之间是相互作用的,这种作用通过向邻近单元传递信号来实现。激活的强度决定一个单元影响相邻单元的强度。把一个单元结合起来就产生一个输出函数,这个函数把当前激活状态映射到输出信号之上。在某些模型中,输出的水平恰好等于单元的激活,在这种情况下,函数F就是一种恒等函数。然而在更多情况下,这是一种阈限函数,既当单元的激活值超过了一定的值时,一个单元才会对另一个单元发生影响。
4. 联结模式
单元与单元之间是互相连结的,在连结主义模型中说明加工单元的联结模式,在于说明这种加工系统的工作以及此系统中编码了的知识。在许多情况下,可以假定每个单元为同它相连结的各个单元的输入增加投入。因此,对这个单元的总收入正好是每一个个别单元的输入的加权和。在这种情况下,连接的权重问题成了连接模式的一个重要问题。权重的大小代表单元间的联结强度权重为正数,表示单元使另一个单元发生了兴奋;权重为负数,表示一个单元抑制了另一个单元。权重为0,表示从一个单元到另一个单元之间没有直接联系.
5. 传递规则
传递规则取一个输出量,它代表着单元的输出值。这个规则还把这个输出值同联结模式结合起来,从而产生一个净输入。传递规则非常简单,如果有兴奋和抑制两种类型的联结,净兴奋输入通常就是对那个单元的兴奋输入的加权和;同样净抑制效应就是对那个单元的抑制输入的加权和。
6. 激活规则
指的是影响某一单元的每一个类型(兴奋和抑制)的各个净输入相互结合,并同那个单元的当前状态相结合,从而产生的一种新的激活状态。
7. 学习规则
改变连接主义模型的加工过程或知识结构,就要调整联结模式。原则上有三种调节模式:新联结的产生,现存联结的遗失,已有联结强度的调整。
8. 操作环境
建立任何模型都要有这个模型得以生存的环境,在联结主义模型中把环境表征成在输入的空间模式上随时间变化的随机函数,即在任何时间点上都可能存在着影响输入单元的一组输入模式。
网络模型可以有几个甚至几百个单元构成,只有一层输入单元和一层输出单元,而没有中间单元的网络模型,被称为模式连接网络(见图6-1)。在此种网络中,输入层单元与输出层单元相连接。输入层与输出层之间排列着一层或多层的中间单元,且每层单元只与相邻连接的网络称为中间单元网络(见图6-2)。从架构上看,网络可以分为前馈网络和反馈网络。前馈网络中每个单元接受前一级的输入,并输出到下一级网络中没有反馈,是一种静态非线性的映射网。反馈网络内的单元间有反馈,是一种动态反馈网络。这种网络的信息处理是状态的变换,可以用动力学系统理论处理。从知识表征上来看,网络可以分为局部网络和分布网络,局部网络中没有中央执行装置,概念或知识的表征是通过特定的单元来实现的。20世纪70年代提出的语义网络,在很多方面都类似于联结主义的局部网络(*比如层次结构模型,真值表模型)。在分布网络中,没有这种特定的单元,概念或知识分布于整个网络的联结中,用网络单元的连接活动来表征。

五、连接主义的基本网络模型举例
如前所述,联结主义网络模型多样,我们这里只介绍最简单,最基础的感知机和三层网络的组织及操作。
1. 感知机
罗森布拉特在1962年发展出一个并行加工机器,命名为感知机,见6-3。感知机是一个简单的网络,它连接着一个模拟眼睛视网膜的觉察器单元和一组输入单元。这些输入单元依次激活输出单元产生一个反应。输入单元和输出单元具有阈限值,如果他们受到的激活超过这个最低水平,他们便会放电。输入单元的放电既可以使输出单元放电——也就是兴奋——的可能性增加,也可能使抑制的可能性增加。这种效果的大小取决于输入单元与输出单元之间的联结的权重。同时,输出单元放电与否也取决于自身的阈限值,以及输入的权重是否超过了此阈限。
在图6-3中,假设输入单元能够觉察视网膜上的不同特征,一个是1一个是0。假定输入单元自身具有非常低的阈限值,他们同时与输出单元之间有+1的权重。输出单元有0.5的阈限值,这样在“1”出现后,相关的输入单元将觉察到它并开始放电,赋予其权重后。就会使得输出单元产生兴奋。这是因为此时的兴奋水平为1,超过0.5的阈限值,因此感知机将产生一个反应。同样如果呈现0,系统也会产生相应产生反应。

感知机可以运用以下简单的规则进行学习:如果所希望的模式并不存在,而感知机错误地产生反应,那么所有当前激活单元的权重都会减少。另一方面,如果感知机未能反应已经存在的希望模式,那么所有的激活单元的权重都会增加。这样如果把每次计算看成正确或错误的答案,同时给网络一个正确与否的反馈,网络产生的正确输出的频率就会增加。当希望模式存在是网络会自动发生反应,反之则不反应。
感知机作为联结主义网络的初期模型,特别是它反映出的自学习自组织思想对整个联结主义理论的研究和发展产生了深远的影响,随后三层网络也被发展起来。
2. 三层网络
明斯基和帕佩特进行了一项研究(1969),他们对感知机的能力和局限进行了详细的数学分析。他们指出,这种两层系统无法解决异或问题,简单些说,就是在网络的两个输出中,任何一个激活时网络作出反应,同时激活则不反应。但这个问题是可以解决的,解决途径之一是在网络中增加一个中间单元,使之位于输入层和输出层之间,见图6-4,只有同时受到一单元和零单元的共同刺激,中间单元才会放电,并有能力抑制反应单元。

在这个例子中,中间单元有1.5的阈限值。这样任何单一的输入单元都不会触发中间单元,只有输入单元同时激活时,它才会做出反应。中间单元可以抑制输入单元,因此抵消了输出单元的兴奋作用,这样系统对输入单元一或输入单元立即作出反应,而对他们同时激活则没有反应。这种三层网络也可以进行训练,其中最常用的程序是反向传播算法(back-propagation algorithm)。
六、联结主义模型的学习和记忆
看来,联结主义模型的工作过程是将输入信息进行转换加工的过程。连接主义模型可以通过学习而具有智能。所谓学习的过程就是不断调整网络的联结权重,以获得希望输出的过程。给网络输入一些模式样本,网络按照一定算法调整其中各层的权重矩阵,直至每一个权重都收敛到一定值时,学习阶段就结束了。
联结主义模型的学习可分为监督学习(有指导的学习)和非监督学习(无指导的学习)。在监督学习中,每次尝试之后,指导者告诉网络输出反应的误差,并给出一个误差范围,网络就会根据规则调整相应的连接权重。如此循环达到一定的学习标准,网络进入一个稳定状态。这种学习方式类似于儿童在教师指导下进行学习,教师不断给儿童反馈信息来纠正他们学习中出现的错误,直到这种错误减少到一个允许的程度。比如前面的感知机模型就采取了监督学习的方法。在非监督学习中,网络在缺乏外界所提供任何形式的反馈条件下进行学习,自主组织它们的权重,以反应呈现的刺激是实现学习功能。这种学习的结果是使网络能够提取训练的统计特征,从而把输入模式,按照他们的相似程度划为若干类。这种学习方式如同儿童在自然环境下和没有导师训练的情况下,通过对外部世界多次观察后对事物形成分类。
由于连接主义模型调整权重的方法不同,于是就形成了不同的学习规则,或者说不同的学习算法,如赫布规则、德尔塔规则(Delta)等,其中最常用的算法是反向传播算法。反向传播算法的基本思想是先给权重设定一个初始值,随后训选择一个训练样本,并计算相对于该样本的误差梯度。通过调整权重使得误差值能够达到全域最小值,直至为零。这种算法实际上是求含误差函数的最小值,通过对多个样本的反复训练,并采用最快下降法,使得权重值沿着误差函数的负梯度方向改变,并收敛于最小点。
连接主义模型的记忆包含两层含义:信息的存储与回忆。通过学习联结主义网络将所获得的知识分布存储在连接权重的变化上,并具有相对的稳定性。网络的学习过程也就是其存储记忆的过程,存储记忆可能需要花费较长的时间,但是一旦形成了某种记忆,它就具有相对稳定性,并且能保持相当长的时间。这就是长时记忆。但是在学习期间,网络计算给定输入模式的输出状态的速度很快,但记忆的保持时间却很短。这种在学习期间产生的记忆就是短时记忆。而且在连接主义模型中,由于各单元是相互连接的,一个单元的兴奋或抑制能够引起相邻单元或者相关单元的兴奋或抑制。因而,联想记忆是连接主义的一个重要特征。
七、连接主义模型的应用
连接主义模型以神经科学为基础,对人的神经系统进行模拟,比认知主义,更具有神经学意义上的合理性。简单单元联结在一起,就具有了复杂的行为和能力,在一定程度上可以像人脑一样工作。
联结主义的神经网络模型可以模拟脑的损伤病灶,损伤可以通过简单地移去已训练的神经网络的一些神经节,或通过在特定神经节连接间移去一些兴奋性或抑制性的连接来模拟。漫射损伤可以通过随机增加和减少网络的激活来模拟。这样整个网络就是完整无缺的,但随意激活使其加工了更多的噪音和无条理性。为了修复打击的损失,可以对患者进行重新训练,使他们执行受到打击前轻松达到的功能。许多研究者采用了对神经网络进行类比的方法,Rosenberg和Sejnowski(1987)训练神经网络进行字词联想和提取,然后损伤神经网络,再用这个神经网络对一些以前学过的同一材料重新进行训练。结果表明神经网络能够重新学习最初的材料,并且重新学习快于最初的学习。进而对最初材料的重新训练,还可以改善对新材料的学习,当把最初的20个联想及区分为两个(一个含有18个联想的重新训练集合,一个含有2个联想的未重新训练集)时,研究发现,在对网络进行18个联想的重新训练之后,网络也表现出对2个没有重新训练的联想集的显著改进。这个发现与人类工作很相似,而在符号模型中很难看到这种复制结果(Harley,1996)
Maresachal和Shultz(1999)提出一个模拟儿童认知发展的联结主义神经网络模型,应用于研究儿童排序能力的发展效果,比符号规则模型要好。其研究结果表明,儿童排序的能力是连续的细微变化,这不同于皮亚杰的图式重构。Hoffman和Dobscha(1989)检验了一个关于精神分裂症的神经基础的观点,他们在分析大脑图像数据后提出一个假设,如果轴突的分支超过青少年大脑的正常值,就可能引发精神分裂症。他们的网络连接分支太多,发生了类似精神分裂的现象。神经网络能够成功模拟许多心理功能和心理现象,比如传统的条件反射跟联想现象、白痴天才、言语习得、概念习得和长时记忆等。我国的心理工作者也利用连接主义神经网络模型进行了一些尝试性的研究,陈鹰和彭聃龄(1994)将并行分布加工思想应用于汉语言认知模型。研究采用分布式的存储结构和并行加工的操作过程,提出汉字识别和命名的连接主义模型(CMRP)。张冬松(1994)等提出一个句子格角色分配的神经网络模型。余嘉元(2001)运用联结主义理论的级联相关模型,以连续异或问题为实例,研究了心理学中的知觉边界效应问题。