← 返回蜂巢洞察

“放松与它在视觉中的作用”:这篇1977年完成的博士论文为现代人工智能研究的发展奠定了基础

当人们想到杰弗里·辛顿时,他们通常会想起反向传播算法、玻尔兹曼机、深度信念网络,以及那些彻底改变了人工智能发展的深度学习技术。 但很少有人会回溯到他科研生涯的起点。 1977年,在那篇著名的关于反向传播的论文发表之前近十年,辛顿在爱丁堡大学完成了他的博士论文,题为《松弛机制在视觉中的作用》。乍一看,这似乎是一篇关于计算机视觉与松弛算法的论文。当我开始阅读它时,我也确实这么认为。 然而,在仔细研读这篇论文后,我意识到它的内容远不止局限于视觉算法。许多后来成为辛顿研究核心的理念,在当时就已经初具雏形。虽然当时的术语不同,数学表达也更简单,神经网络也尚未成为他研究的重点,但那种思考方式已经存在了。

当人们想到杰弗里·辛顿时,他们通常会想起反向传播算法、玻尔兹曼机、深度信念网络,以及那些彻底改变了人工智能发展的深度学习技术。

但很少有人会回溯到他科研生涯的起点。

1977年,在那篇著名的关于反向传播的论文发表之前近十年,辛顿在爱丁堡大学完成了他的博士论文,题为《松弛机制在视觉中的作用》。乍一看,这似乎是一篇关于计算机视觉与松弛算法的论文。当我开始阅读它时,我也确实这么认为。

然而,在仔细研读这篇论文后,我意识到它的内容远不止局限于视觉算法。许多后来成为辛顿研究核心的理念,在当时就已经初具雏形。虽然当时的术语不同,数学表达也更简单,神经网络也尚未成为他研究的重点,但那种思考方式已经存在了。

这篇综述并不是对这篇论文的逐章总结,而是着重探讨我在阅读过程中觉得特别重要的那些理念,并分析它们在辛顿后来的研究中是如何反复出现的。其中一些理念后来成为了现代人工智能发展的核心,而另一些尽管在近五十年前就被提出过,却至今仍被人们忽视。

回顾起来,最让我印象深刻的是,这篇论文并没有预测出具体的算法,而是提出了一种关于智能、感知与计算的一致性思考方式,这种思路在之后的几十年里一直指导着辛顿的研究方向。

我希望这篇综述能鼓励更多人去阅读这篇杰出的论文——不仅仅把它视为一份历史文献,而应该将其看作是人工智能领域最具影响力的一段研究历程的起点。

论文概述

在这篇文章中,我们将深入探讨杰弗里·辛顿于1977年在爱丁堡大学完成的博士论文《松弛机制在视觉中的作用》。

首先,我们会分析辛顿试图解决的核心问题,以及促使他采用松弛算法的思想来源。接着,我们会探讨这篇论文是如何表达不确定性、如何对各种竞争性假设进行推理、以及如何寻找全局一致的解释方法的。

随后,我们会研究论文中提到的“木偶程序”、“松弛运算符”、模式与存储知识在其中的角色、SETTLE系统,以及辛顿与其他当时研究方法的比较。我们还会讨论他在自己提出的方法中指出的局限性,以及这些局限性为何重要。

最后,我们会看看这篇论文中提出的许多理念是如何在辛顿后来的研究中反复出现,并最终推动现代人工智能发展的。

如果你有兴趣深入了解,也可以直接阅读这篇原始论文:

杰弗里·辛顿.《松弛机制在视觉中的作用》. 博士论文, 爱丁堡大学, 1977年.

这是一份信息图,简要概述了杰弗里·辛顿在1977年完成的博士论文。它总结了该论文的主要观点、松弛方法的工作原理、应用范围、局限性,以及为什么这些观点至今仍然具有重要意义。

这份信息图总结了杰弗里·辛顿1977年的博士论文《松弛方法在视觉识别中的作用》。它重点介绍了论文的核心观点、研究方法、关键发现、应用领域、局限性,以及这一理论对现代人工智能发展的影响。

目录:

核心挑战:为何视觉系统不能过早地做出猜测

在探讨希顿论文中的观点之前,了解他试图解决的问题是很有帮助的。开篇章节提出了一个看似简单的问题:当一张图片可能存在多种合理的解释时,视觉系统该如何选择正确的解读方式呢?

这就是视觉感知所面临的核心挑战。现实世界中的场景往往具有模糊性或部分被遮挡,因此系统不能过早地确定某一种解释。如果过早做出决定,就可能会引入错误,而这些错误会影响到后续的推理过程,最终导致对整个场景的误解。

真正的挑战在于,在有足够的证据来确定哪种解释最为合理之前,要让多种可能的解释都保持开放状态。

希顿认为,20世纪70年代常见的方法并没有解决这个问题。其中一种方法被称为最小承诺原则,它通过不具体说明某些信息来推迟决策的时机。但根据希顿的观点,这种方法只是将问题暂时搁置起来,并没有提供任何比较各种假设或确定它们如何才能相互一致的方法。

另一种方法则为低层次的视觉特征赋予了固定的含义。然而,由于特征的含义取决于其所处的环境,因此当物体被部分遮挡或出现在不同的情境中时,这些僵化的定义往往就会失效。

下图概括了希顿在论文开篇指出的这一核心挑战。他认为,视觉系统不应该立即选择对视觉场景的第一个合理解释,而应该同时保留多种竞争性的假设,并让它们相互作用,直到最终得出一个全局一致的解释结果。

该图表还指出了希顿所反对的两种现代方法:最小承诺原则僵化的特征语义学,因为在希顿看来,这些方法并没有真正解决核心问题,反而回避了它。

这种观点为论文后续部分提出的放松框架奠定了理论基础。

希顿1977年博士论文中关于并行放松机制的示意图

将思维视为优化过程的首次出现

希顿论文中一个非常有趣的观点是,感知并不是瞬间识别出某个对象的过程,而应该被视为寻找眼睛所看到的事物最佳解释的一个过程。

该系统并不会从一开始就确定某种唯一的解释方案,而是会同时考虑多种可能的假设。其中一些假设彼此相互支持,而另一些则存在冲突;这些假设在相互作用的过程中,其“可信度”也会发生变化。通过反复的更新过程,那些站不住脚的、不合理的解释会逐渐被淘汰,而最合理、最具说服力的解释方案最终才会脱颖而出。

尽管希顿将这一理念应用于视觉感知领域,但其根本原理其实远远超出了计算机视觉的范畴。它提供了一种将智能视为优化问题的思考方式:众多可能的解释会相互竞争,直到系统选出最符合现有证据的那个解释。

回顾起来,这个理念显得出奇地熟悉。后来,在概率推理、基于能量的模型、条件随机场、玻尔兹曼机等诸多方法中,也都出现了同样的哲学思想——智能是通过寻找最一致的解决方案而产生的,而不是通过立即做出某个决定来实现的。

视觉是一种推理过程,而非简单的模式匹配

在整篇论文中,希顿关于“看见”的本质这一观点尤为突出。他认为,视觉并不仅仅是识别模式或将图像归类到某个类别中,而是构建对场景的内部解释的过程。

视觉系统并不会立刻知道自己正在观察什么。它必须判断出哪些物体存在于该场景中,这些物体之间是如何相互关联的,以及哪种解释最能符合现有的证据。换句话说,“看见”实际上是一个推理过程,而不仅仅是识别行为。

希顿还否定了这样一种观点:即感知是通过将输入信息与存储在内存中的模板进行比较来实现的。他认为,这种观点过于狭隘,无法解释我们是如何理解那些复杂且陌生的场景的。

实际上,感知是一个构建性的过程。系统会结合各种证据、物体之间的关系以及先前的知识,逐步形成一种连贯的解释。它并不是从记忆中检索答案,而是主动地构建出这样的解释。

如今读到这些观点,会让人感到十分震撼,因为它们与几十年后才流行起来的许多理念极为相似。现代的生成模型和潜在变量方法,也都是基于通过推理来揭示产生观察结果的隐藏结构这一理念而发展起来的。

这些思想也与现代的表示学习理论非常接近——后者的目标并不是记忆具体的例子,而是学习那些能够解释新观察结果的有意义的内部表征。

早在1977年,希顿就已经在探索这些思考方式了,而那时它们还远未成为现代人工智能的核心主题。

为什么感知需要假设

希顿认为,感知不可能仅仅是一个被动的反应过程。视觉系统经常会接收到不完整、模棱两可甚至具有误导性的信息,因此它不能简单地接受第一个浮现在脑海中的解释。

相反,它必须从多个可能的解释出发。随着更多证据的被考虑进去,某些假设会变得越来越有说服力,而另一些则会被削弱或被否定。只有经过这样的评估和优化过程,最终才能得出正确的解释结果。

尽管希顿并没有用现代贝叶斯术语来描述这一机制,但其核心思想却非常相似。该系统并不会立即做出决策,而是会随着证据的不断积累而持续更新自身的信念,直到最终留下最一致的解释。

从二进制决策到信念程度

另一个极具现代气息的理念是,希顿避免将假设简单地视为正确或错误。相反,他会为每个假设分配一个介于0和1之间的数值,这个数值反映了系统当前对该假设的信任程度。在放松过程逐渐展开的过程中,这些数值会不断被更新,直到最一致的解释脱颖而出,而其他解释则逐渐被忽略。

如今,我们用不同的术语来表达类似的概念,比如概率、信念值、置信度分数、激活值以及logit值。这些术语虽然多年来有所演变,但其根本思想始终未变:智能往往体现在如何处理不确定性,而不是立即做出不可逆转的决策。

下图说明了在为假设分配了连续的信念值之后,希顿提出的放松过程是如何运作的。

系统并不会立即选择某个答案,而是会同时并行地更新所有竞争性的假设,通过数值约束和个体偏好等因素的作用,最终使一个连贯的解释逐渐显现出来。

通过用连续优化取代僵化的二进制决策,这种放松框架使得人们能够高效地寻找出全局一致的解决方案。

这张信息图展示了希顿提出的理念:为每个假设分配0到1之间的置信度数值,而不是简单的正确或错误判断。它说明了这些数值是如何在不断更新的过程中,最终得出最一致的解释的。

神经网络出现之前的分布式计算

这篇论文中最具前瞻性的观点之一是:智能不应该依赖于某个中央控制器来做出所有决策。相反,希顿描述了一个由许多局部假设组成的系统,这些假设会同时相互作用。每个假设都会为最终解决方案贡献其中的一部分,而它们共同作用后,就能产生一个连贯的解释。

希顿并没有关注各个单独的组成部分,而是强调了这些连接如何使信息在系统中流动,从而最终形成一致的解释。

这种思维方式在今天看来显得格外熟悉。现代神经网络也正是基于这样的理念构建的:复杂的行为往往是由许多简单单元的共同作用产生的,而不是由某个单一组件来主导整个过程。

这些概念与现代深度学习有所不同,但其中对网络、相互作用以及分布式计算的重视已经非常明显了。

并行性:自然的计算方式

另一个值得注意的观点是辛顿对并行计算的强调。在当时大多数计算机都是按顺序执行指令的情况下,他认为感知过程实际上是由许多同时运行的进程相互影响而形成的。 回顾起来,这种观点具有极其前瞻性。在大规模并行硬件尚未普及的几十年前,辛顿就已经用一种与现代神经网络的工作方式极为相似的方式来描述计算过程了——也就是让许多简单的操作同时进行,而不是按顺序依次执行。

约束传播

这篇论文中反复强调的一个观点是:任何假设都不应该被孤立地加以评估。实际上,这些假设是通过一系列约束关系相互影响的。当某个假设的置信度发生变化时,这种变化会通过整个约束网络传递开来,从而强化那些彼此兼容的解释,削弱那些相互矛盾的观点。 后来,这一理念在人工智能的多个领域都成为了普遍的研究方向。图模型、因子图、消息传递以及信念传播等方法,全都基于同一个基本原理:局部的相互作用最终能够产生一个全局一致的结论。 尽管这些方法是在后来发展起来的,而且使用了不同的数学框架,但它们之间的概念联系其实是非常明显的。 为了展示约束关系在放松过程中是如何相互作用的,辛顿选择了一个经过刻意简化的视觉任务作为研究对象,而不是使用真实的照片。 用户首先在图形终端上绘制几个透明且相互重叠的矩形。其中一些矩形代表stick-figure人偶的真实组成部分,比如躯干、手臂或腿部,而另一些则只是用来干扰用户的注意力。 这些矩形之间的所有重叠部分都可能成为连接点,系统会生成多种不同的假设,来判断哪些矩形属于人偶,哪些重叠部分确实代表了真实的连接关系。系统的目标是要找到那种能够产生最多相互一致的解释结果的方案,同时也要保证在某些身体部位缺失或存在无关干扰因素的情况下,该方案依然能够正确运行。 通过去除自然图像中的复杂性,辛顿将视觉解释过程中所面临的组合问题单独提取了出来,从而使这个问题在数学上变得易于处理。 下图说明了辛顿是如何利用这个简化的模型来测试放松机制的。通过将视觉任务简化为识别一致的身体部位和连接点,这个例子清晰地展示了如何将许多相互竞争的局部假设整合成一个全局一致的结论。 虽然这个实验设计得非常简单,但它却准确地抓住了计算机视觉领域中最核心的推理问题:许多局部假设会同时存在并相互竞争,约束关系会在它们之间传递,而最终只有那个在全球范围内最为一致的解释才能被保留下来。

欣顿将这一领域视为一个受控实验室,在将相同的松弛原理应用到更现实的视觉问题之前,先在这里研究这些相互作用机制。

信息图展示了欣顿设计的木偶测试模型:其中重叠的矩形代表可能的身体部位。该系统通过约束条件和松弛算法来确定哪些矩形组合能形成最符合逻辑的简笔画木偶形象。

局部规则能够产生全局性智能

在这篇论文中,我最感兴趣的一点就是:如何通过简单的局部相互作用产生复杂的解决方案。每个假设只需要与直接与其相连的其他假设进行交流即可,不存在一个中央组件来掌握正确答案或控制整个过程。

当信息在网络中传播时,系统会逐渐形成一种一致的解释结果。最终的结果是各种组件合作的结果,而非通过指令强制产生的。

这一原理在人工智能研究中屡见不鲜。神经网络、群体智能、图神经网络以及信念传播机制,都证明了复杂的行为是如何由许多遵循局部规则的简单组件共同作用而产生的。

这个木偶测试案例并非只是一个简单的示例,而是一个具有完整处理流程的程序。系统从一组重叠的矩形开始,生成各种假设,应用约束条件,反复调整各假设的置信度,最终选出最符合逻辑的解释结果。

下面的信息图展示了欣顿的整个松弛框架是如何作为一个完整的计算流程来运作的。它说明了假设生成、约束条件构建、迭代松弛以及最终选择这三个步骤是如何作为单一推理过程的连续环节而发挥作用的。

该系统并非依赖中央控制器或现代的端到端训练方法,而是通过竞争性假设之间的反复局部相互作用,最终得出一致的解决方案。这恰恰证明了简单的局部规则能够产生全局一致的行为结果。

信息图展示了欣顿木偶程序的端到端处理流程:从一组重叠的矩形开始,系统生成假设,构建约束条件,应用松弛算法,迭代更新各假设的值,最终得出最符合逻辑的木偶形象解释。

为什么局部一致性还不够

欣顿指出了一个重要的观点:解决局部的冲突并不一定能产生最佳的整体解释结果。某个假设可能与其直接相邻的假设非常吻合,但它仍然可能导致对整个场景的错误理解。

正因为如此,系统必须评估所有这些假设是如何共同发挥作用的,而不能单独地评判每一个假设。

从追求局部一致性转向寻找最佳的整体解决方案,这一理念是整篇论文的核心主题。它也反映了人工智能后续发展的一个重要方向:许多问题应该被视作全局优化问题来处理,而不仅仅是一系列孤立的局部决策。

放松作为一种推理方法

在阅读这篇论文的过程中,我逐渐意识到“放松”并不仅仅是一种算法,它更是一种解决复杂问题的思路。系统不会试图一步就得出正确答案,而是先提出一些初步的假设,通过反复的交互来不断完善这些假设,直到最终得到稳定的解决方案。

如今看来,这个理念显得格外熟悉。虽然数学表达方式有所不同,但许多现代方法其实都遵循着同样的原理:梯度下降法是逐步优化参数;期望最大化算法会在不同阶段之间进行迭代;信念传播机制会不断交换信息;而扩散模型则是通过一系列渐进式的更新来生成样本。

这些方法表面上看似各不相同,但其根本理念却非常相似:优秀的解决方案往往是通过许多小的改进逐渐形成的,而不是通过某一次决定性的计算得出的。

那么,“放松”这种机制究竟是如何发挥作用的呢?Hinton的解释其实非常简单:在每次更新过程中,系统会同时平衡两种力量——一种力量确保假设与各种约束条件保持一致,另一种力量则促使这些假设朝着更合理的方向发展。通过反复执行这一过程,最终就能得到稳定的解决方案。

下图展示了Hinton是如何将这种推理机制转化为具体的计算流程的:系统不会一次性做出决定,而是会并行地更新所有假设,不断应用这两种平衡力量,直到整个系统进入一个稳定且全局一致的状态。

这个过程清楚地说明了:简单的局部更新如何能够共同产生一个连贯的整体解释结果。

解释Hinton的放松机制的信息图。每次更新都会同时考虑两种力量:一种力量确保假设与约束条件相符,另一种力量则促使这些假设朝着更合理的方向发展,如此反复进行,最终就能得到稳定的解决方案。

平衡状态的重要性

整篇论文中还有一个核心观点,那就是让系统达到稳定状态的重要性。最终的解释结果并不是由中央控制器强行规定的,也不是根据某种固定规则选出的。相反,它是随着各种假设之间的相互作用而自然形成的,直到系统不再需要任何进一步的调整为止。

这一理念在希顿后来的研究中反复出现。霍普菲尔德网络、玻尔兹曼机器以及基于能量的模型,都依赖于系统通过自身的内部机制逐渐演化到稳定状态。尽管这些模型各不相同,但其根本思想却大体一致:一个好的解决方案,就是系统能够自然地达到的那种状态。

希顿不仅描述了哪些方法有效,还分析了在某些情况下放松过程可能会出错的情况,既探讨了系统可能收敛于模糊中间解的可能性,也指出了整个框架在架构上的局限性。

下图说明了这两种局限性。在放松过程中,系统可能会收敛到一个介于多种不同解释之间的稳定状态,而不会最终确定其中某一种解释。

这一现象还暴露出一个更根本的架构缺陷:假设的产生与筛选仍然是两个独立的步骤,这就导致后续的推理过程无法影响最初哪些候选假设会被生成。

希顿明确指出了这些局限性,而后来的人工智能系统也通过更加集成、端到端的学习方法来克服这些问题。

解释希顿放松方法局限性的信息图。该图展示了系统如何会收敛到一个介于两种有效解释之间的稳定状态,而非得出一个明确的答案。

从符号化决策到数值推理

这篇论文中一个微妙但重要的变化,就是不再将知识简单地视为对或错。希顿没有依赖僵化的符号化判断,而是用数值来表示各种信念,并且这些数值会随着新证据的出现而发生变化。

这一设计看似简单,但实际上它反映了智能系统进行推理方式的重大转变。系统不会强行做出初始决策,而是会持续关注不确定性,并随着时间的推移调整自己的信念。回顾历史,现代机器学习的许多发展方向其实都是沿着这个思路前进的。

希顿并不是孤立地提出这些想法的。在论文中,他将自己的放松框架与其他当时流行的方法进行了对比,分析了它们在表达不确定性和处理视觉信息时所采用的不同方式。

下图同时展示了三种方法的工作原理。以相同的线段标注问题作为基准,该图说明了沃尔兹的过滤算法、模糊权重模型以及希顿的放松框架是如何分别处理不确定性、更新假设并确保结果一致性的。

希顿认为,他的假设值框架通过将连续的置信度数值与明确的数值约束结合起来,为在不确定环境下进行推理提供了一种更加严谨的方法,从而使各种相互矛盾的解释能够朝着全局一致的解决方案方向发展。

这是一张信息图,对比了Hinton的L.P.松弛方法与Waltz过滤算法以及模糊权重模型。该图说明了这三种方法是如何体现不确定性的,同时也解释了为什么Hinton认为他的假设值框架能够提供更有效的解决方案。

为什么感知本质上是一个搜索过程

在这篇论文中,有一个观点被反复提及:感知从根本上来说就是一个搜索过程。视觉系统并不是简单地根据所看到的信息来识别物体,而是会在众多可能的解释中寻找最符合现有证据的那个解释。

这种区别其实比表面上看起来更为重要。“识别”意味着答案已经很明显了,只需要将其提取出来即可;而“搜索”则意味着必须通过探索各种可能性并消除不确定性,才能找到正确的解释。

即使在今天,这种思维方式仍然在影响着许多人工智能技术的发展方向。

如果将感知视为一个搜索过程,那么下一个问题就是:系统究竟在搜索什么?Hinton通过引入一种几何视角来解答这个问题——在他看来,每一个可能的解释都对应着可行解空间中的一个位置。

下图展示了这种几何视角。图中,所有有效的假设都被表示为可行搜索空间内的点,其中角落代表明确的“全有或全无”的解释,而中间的点则代表不确定或部分正确的理解。

松弛过程并不是在离散的解之间直接进行搜索,而是连续地在这个空间中移动,逐步改进当前的状态,直到找到得分最高的那个可行解释为止。

这种几何视角为我们提供了一种直观的理解方式,帮助我们理解为什么松弛算法能够将一个复杂的组合搜索问题转化为一个连续优化问题。

这张信息图展示了Hinton关于感知本质上是通过探索多种可能的解释来进行搜索的观点。它描绘了可行状态的空间结构,并说明了如何通过逐步优化过程,使系统从不确定的状态逐渐走向最一致、最合理的解释。

超越模式识别:为什么内部表征比最终输出更为重要

这篇论文中最为发人深省的部分之一,就是Hinton对将感知仅仅视为模式识别的观点所提出的批评。他认为,仅仅识别视觉特征是远远不够的,因为一个视觉系统还必须弄清楚物体之间的关系、它们的组成部分是如何组合在一起的,以及这些关系如何共同构成对世界的连贯理解。

这种对关系结构的重视,正是希顿关于感知机制观点的核心所在。要理解一个场景,仅仅识别出其中的各个对象是不够的;系统必须能够表征这些对象、它们的构成部分,以及将它们联系在一起形成整体结构的关系。换句话说,感知的本质在于构建出一个结构化的场景表征,而不仅仅是识别一些孤立的模式。

在阅读这篇论文的过程中,有一个主题不断浮现:与最终的结果相比,希顿更关注系统在解读场景时所形成的内部表征。其目标并非仅仅给图像贴上一个标签,而是要构建出一种能够捕捉其各组成部分之间关系的结构化描述。最终的决策结果,其实只是这一更为复杂推理过程的结果罢了。

回顾起来,这种观点具有极其前瞻性。许多现代人工智能系统已经超越了简单的分类功能,开始学习那些能够捕捉结构、关系及上下文信息的内部表征。尽管如今的模型使用了截然不同的数学工具,但其背后的直觉本质却是高度相似的。

在希顿后来的职业生涯中,他始终强调:一个智能系统的质量,与其最终输出的结果相比,更多地取决于它在学习过程中形成的各种表征。

中间层次表征与层级结构的重要性

其中一个让我印象深刻的概念是希顿关于中间层次假设的论述。他认为,感知过程并不是直接从视觉输入跳到最终的解释结果,而是借助那些能够衔接原始观察数据与完整理解之间的中间表征来实现的。

对一个场景的理解是一个多层次的过程:简单的元素会组合成更复杂的结构,而这些结构又会进一步促成更为深入的理解。感知能力是通过层层递进的层级结构逐步构建起来的,而不是瞬间形成的。

回顾这些观点,我们会发现它们显得格外熟悉。现代深度学习正是建立在中间层次假设这一原则之上的——每一层都会学习到越来越抽象的表征信息,最终才能得出预测结果。

而这种层级化的感知机制,在希顿后来的研究中反复出现。无论是深度信念网络、胶囊网络,还是分层生成模型,这一原理都始终未变:有意义的表征信息是逐层构建起来的,每一层都会捕捉到前一层所无法识别的模式。

虽然术语有所变化,但背后的直觉本质却大体相同:复杂的理解能力是通过一系列中间层次的表征逐步形成的,而非通过一步到位的方式获得的。

图式与存储的知识

在后面的章节中,希顿提出了“图式”这一概念,认为它是一种组织知识并将其与感知过程联系起来的有效方式。他并没有将感知与存储的知识视为彼此独立的过程,而是说明了它们是如何共同作用来解读系统所观察到的信息的。

在这些章节中,最引人注目的观点之一就是希顿对“模式”的理解。他认为,知识不应该仅仅存储具体的例子,而应该把握定义某一类别的规则、关系及约束条件。这样一来,系统就能通过分析新情况背后的结构来对其进行解读,而不只是简单地将其与已有的信息进行匹配。

读到这些内容,我们很容易理解为什么这一观点至今仍然具有现实意义。尽管相关术语已经发生了变化,但许多现代人工智能系统依然依赖于那些能够支持泛化学习的内部表示机制,而非单纯的记忆功能。从这个意义上说,希顿关于“模式”的论述可以被视为后来发展出“潜在表示”和“内部世界模型”这些概念的早期探索。

下图说明了希顿将基于模式的推理与模板匹配区分开来的观点。模式并不依赖于存储好的具体例子,而是通过角色、关系及约束条件来体现结构化的知识,从而指导系统的解读过程。面对新的观察结果,系统是通过满足这些结构关系来理解它们的含义的,而不是去寻找与记忆中的模板完全匹配的内容。

这种视角预示了后续在表示学习领域的发展方向——成功的泛化能力取决于对事物内在结构的理解,而非对个别例子的死记硬背。

这张信息图阐释了希顿关于“模式”的概念,它将基于模式的推理与模板匹配进行了对比,说明了规则和关系是如何帮助系统理解新案例的,而不是依赖存储好的固定模式。

SETTLE系统

这篇论文中还有一个值得重点关注的部分,那就是希顿开发的实验性推理系统SETTLE。这个系统将模式、推理规则以及放松算法整合到了一个统一的计算框架之中。虽然它常常被前面讨论放松算法的章节所掩盖,但事实上,它恰恰体现了希顿早期试图将多种形式的推理方法结合起来进行处理的思路。

SETTLE系统并不单独应用各种规则,也不孤立地存储知识,而是让模式、推理规则、放松算法以及动态网络构建机制协同工作,从而使系统能够从不确定的证据中逐步得出最一致的解释结果。

回顾历史,SETTLE系统的意义并不在于它与现代人工智能系统的细节上有多少相似之处,而在于它体现了希顿早期试图将知识、推理与推断过程融合为一个统一的计算体系的努力。

下图展示了这些组件在SETTLE系统中的相互作用方式:推理规则生成各种可能的结论,而放松算法则不断评估这些结论之间的一致性。通过这种机制,证据、规则以及相互竞争的假设能够彼此影响,最终形成最合理的解释结果。

这张信息图解释了Hinton的SETTLE系统。它展示了模式、推理规则以及松弛机制是如何协同工作,从而评估证据、进行推理并构建出最一致的解释结果的。

不确定性与模糊性:推理的基础

贯穿这篇论文的一个核心观点是:不确定性并非需要回避的问题,而是感知过程的自然起点。视觉系统并不会从完备的知识或绝对的确定性开始工作,而是基于一些初步的假设进行运作,而这些假设会随着更多证据的积累而被逐步修正、削弱或最终被抛弃。

与这一观点密切相关的是Hinton对模糊性的处理方式。他并没有将多种可能的解释视为感知上的失败,而是认为这些现象是信息不完备所导致的必然结果。

一个视觉场景可以有多种合理的解释方式,系统应该允许这些可能性共存,直到有足够的证据来区分它们。而不是强迫系统过早地做出决定,系统会逐渐趋向于形成最一致的解释结果。

尽管Hinton的论文早于现代的概率图模型和贝叶斯推理方法,但其根本理念与概率思维非常接近。

在接下来的几十年里,相关的数学工具确实发生了很大的发展,但核心思想始终未变:智能系统应该能够在不确定性环境中进行推理,而不是从一开始就期望获得完整且准确的信息。回顾历史,我们不难理解为什么这种观点会成为现代人工智能的重要原则之一。

全貌一览

下面的信息图将Hinton论文的主要贡献汇总在了一起,帮助人们全面了解其研究内容。它将Hinton提出的松弛机制与其他20世纪70年代末期的方法进行了比较,概述了论文中探讨的各种应用领域(从简化的视觉任务到基于模式的推理以及SETTLE系统),并指出了Hinton明确指出的关键局限性。

综合来看,这篇论文不仅仅是一种松弛算法的提案,更是一个关于在不确定性环境中进行推理的广泛研究框架,它对后来发展起来的许多人工智能技术产生了重要影响。

这张信息图总结了Hinton在1977年发表的论文。它将Hinton的松弛方法与当时的其他方法进行了对比,概述了论文中探讨的主要应用领域,并指出了未来需要进一步研究的关键问题。

五十年来一以贯之的研究哲学

完成这篇论文后,最让我印象深刻的不是一种具体的算法或实验,而是Hinton思维方式的连贯性。他在1977年提出的许多理念,在他之后的整个职业生涯中不断被反复运用,尽管所使用的数学工具和模型发生了巨大的变化。

这篇论文最初探讨了松弛机制、竞争性假设、分布式约束、优化过程以及稳定解的概念;后来又涉及了玻尔兹曼机、反向传播算法、深度信念网络、AlexNet、前向-前向算法,而最近他还提出了关于“有限计算能力”的理论。

乍看之下,这些研究成果似乎彼此迥异,但实际上它们都受到一种极其一致的研究哲学的指导。

在整个职业生涯中,Hinton始终认为智能是许多简单计算元素相互作用的结果,而不是由某个中央控制机制产生的。他一贯强调分布式知识体系的重要性,反对将信息简化为孤立的符号;重视推理过程而非简单的识别能力;认为丰富的内部表征比最终输出结果更为重要;将优化视为实现智能行为的有效手段;同时他也认为不确定性是需要被理解和处理的对象,而不是可以被忽视的因素。

从今天的角度来看,Hinton在1977年撰写的这篇论文,与其说是一篇早期研究的独立成果,不如说它标志着一场智慧之旅的开始——这场旅程影响了近五十年来人工智能领域的发展方向。

这张信息图正是为了阐释这些概念上的联系。它并没有将Hinton后来的研究成果简单地视为他对1977年论文的直接应用,而是展示了包括连续置信值、基于优化的感知机制、结构化知识表示以及集成推理能力在内的许多核心理念,是如何在玻尔兹曼机、反向传播算法、深度信念网络以及基于能量的模型等后续研究中不断得到体现的。

重点并不在于某一条具体的技术发展路径,而在于那种将Hinton早期研究与其后期成果紧密联系起来的连贯的研究哲学。

这张信息图总结了Hinton 1977年论文中的主要理念,并展示了这些理念是如何在玻尔兹曼机、反向传播算法、深度信念网络以及基于能量的模型等后续研究中得到体现的,从而突显了他研究哲学的连贯性。

出版许可

在撰写这篇评论之前,我联系了Geoffrey Hinton教授,请求获得发表这篇关于他论文的教育性评论的许可。Hinton教授慷慨地同意让我发表这篇文章。

这篇文章完全是我根据自己的理解和解读撰写的,同时也充分尊重了原作者的工作成果。

进一步阅读资料

联系我

相关文章

技术实践

人工智能如何改变补丁更新流程,以及开发人员需要了解哪些关于漏洞暴露管理的相关知识

当漏洞扫描工具报告你的应用程序存在23个安全漏洞时,其中4个属于严重等级,7个为较高风险等级,剩下的12个则为中等风险等级,乍一看,解决办法似乎很明确:立即开始修补这些漏洞。但究竟应该先修复哪一个呢? 这在漏洞管理中一直是个棘手的问题。虽然安全团队可能会及时发现存在漏洞的代码依赖项,但并不总能立刻对其进行修复。开发人员需要确保这些有漏洞的代码仍在被使用中,并在将修复方案部署到生产环境之前完成所有必要的测试。 不过,最近在利用人工智能来检测软件漏洞及攻击手段方面确实取得了一些显著的进展。例如,这篇 研究 就详细介绍了相关的研究成果以及未来的发展方向。 但这一切究竟如何才能真正帮助开发社区呢?我们

阅读全文
技术实践

如何使用屏幕阅读器来使用 Discord:快速指南

Discord就是这样一种技术:几年前它突然出现,如今已经无处不在。 各种社区、项目和倡议都建立了大量的服务器,而且这类服务器还在不断涌现。在很大程度上,它们已经取代了论坛、聊天室,有时甚至也替代了文档网站和新闻板块的功能。 这种变化究竟是好是坏,还有待讨论,但可以肯定的是,Discord将会长期存在下去。 就可访问性而言,Discord曾经面临过一些问题。多年来,对于使用屏幕阅读器的用户来说,使用这款软件一直非常不便,因为开发者显然没有充分考虑过可访问性的需求。 不过在过去的几年里,这种情况已经得到了显著改善。虽然到2026年时,Discord仍然不是完全适合所有用户使用的工具,但只要掌握了

阅读全文
技术实践

人工智能接待员的工作原理:人工智能电话客服系统背后的技术架构

从表面上看,人工智能接待员似乎很简单:来电者说话,系统做出响应,然后对话持续进行,直到来电者得到答案或与相关人员取得联系。 但实际上,在这一对话的背后,存在着一系列电话基础设施、语音识别技术、语言模型、应用逻辑、应用程序接口、数据库以及呼叫路由机制。 有趣的地方并不在于人工智能模型本身,而在于这些组件是如何协同工作,将音频流转化为有用的商业行动的。 那些希望拥有这类功能的企业有两种选择: 它们可以购买现成的产品。目前市场上已经有专门的人工智能接待系统,比如Nextiva公司的 XBert ,以及Goodcall、Dialzara等公司提供的相关工具。 或者,它们也可以自行开发这样的系统,而这篇

阅读全文
技术实践

如何使用Node.js、Express和MongoDB构建一个用于奖学金申请研究的MCP服务器

寻找奖学金信息其实是一项需要系统地进行研究的任务,而不仅仅是通过简单的搜索来完成的。你需要根据学科领域、平均成绩、国籍以及截止日期等条件来筛选各类奖学金信息,然后列出候选名单,并对相关申请材料及推荐人的意见做好记录。一周后,你再回顾这些信息,尝试回忆自己当初为什么选择保存某个具体的奖学金项目。 人工智能助手可以帮助完成这一工作流程,但前提是它必须能够访问真实的数据库,并能保留你之前所做的筛选和决策结果。聊天记录并不能替代数据库;而那些被错误设定的截止日期反而会比根本没有截止日期更糟糕。 Model Context Protocol (MCP) 为人工智能应用程序提供了获取这类信息的标准接口。在

阅读全文