← 返回蜂巢洞察

创造了现代人工智能的那篇论文:Transformer背后的故事

每次你与现代人工智能模型进行交互时,其实都在使用一种源于2017年那篇名为《注意力才是关键》的研究论文所提出的架构。 我们在freeCodeCamp.org的YouTube频道上发布的最新视频,详细讲述了八位谷歌研究人员是如何着手改进Google Translate的,最终又如何彻底改变了整个科技领域的格局的。 在这一突破性成果出现之前,人工智能领域主要依赖循环神经网络。这类模型会按顺序逐词处理文本,但这带来了两个巨大的障碍: “上下文丢失”:当处理长句或长段落时,模型会忘记开头那些重要的信息。 “训练速度缓慢”:由于需要顺序处理数据,各个步骤无法并行执行,因此即使使用庞大的GPU集群,模型的

每次你与现代人工智能模型进行交互时,其实都在使用一种源于2017年那篇名为《注意力才是关键》的研究论文所提出的架构。

我们在freeCodeCamp.org的YouTube频道上发布的最新视频,详细讲述了八位谷歌研究人员是如何着手改进Google Translate的,最终又如何彻底改变了整个科技领域的格局的。

在这一突破性成果出现之前,人工智能领域主要依赖循环神经网络。这类模型会按顺序逐词处理文本,但这带来了两个巨大的障碍:

  • “上下文丢失”:当处理长句或长段落时,模型会忘记开头那些重要的信息。

  • “训练速度缓慢”:由于需要顺序处理数据,各个步骤无法并行执行,因此即使使用庞大的GPU集群,模型的训练速度也依然很慢。

研究人员提出了一个简单的问题:如果模型能够同时理解整段文本,会怎么样呢?

通过将“注意力机制”从原有的处理流程中分离出来,并完全摒弃顺序处理的模式,他们创造了Transformer这一全新的架构。这种新架构不仅超越了现有的翻译技术标准,而且在训练所需的时间上也大幅减少。

并行处理能力的实现使得模型能够有效地处理规模庞大的数据集。正是这一突破为当今的生成式人工智能技术奠定了基础,也让这篇论文的作者们后来创立了Cohere、OpenAI和Character.ai等知名的人工智能企业。

想要深入了解这篇论文是如何改变计算机技术的,请访问freeCodeCamp.org的YouTube频道

相关文章

技术实践

从Mixtral到Kimi K3:专家混合模型是如何发展的

在本文中,我们将探讨混合专家模型是如何从最初仅有少数几个“专家”组件,发展到每层包含近900个“专家”组件的,以及那些使得这种稀疏架构仍能保持可训练性且成本可控的压缩机制与稳定性机制。 开放权重的混合专家模型发展速度惊人:Mixtral的总参数数量约为470亿,DeepSeek-V3达到了6710亿,而Kimi K3的参数数量更是突破了万亿大关。令人惊讶的是,并非这些模型的规模本身,而是每个模型实际上只使用极少量参数来处理每一个输入数据。 Kimi K3拥有2.8万亿个参数,但其中仅有约1040亿个参数被用于处理任何一个输入数据。在几乎每一层中,都有一个小型“路由器”从896个专门的前馈网络中

阅读全文
技术实践

演讲主题:克劳德能够自我修复吗?利用大型语言模型进行事件响应

人类可靠性工程师亚历克斯·帕尔库埃分享了关于如何利用大语言模型来应对现实世界中的突发事件的相关经验。他解释了为什么人工智能在分析日志和追踪数据时能够发挥“超人般”的作用,为何在根本原因分析过程中,它仍然难以区分因果关系与相关性,以及工程领域的领导者该如何将人工智能融入到应急响应的工作流程中,同时避免削弱人类的专业能力。 作者:亚历克斯·帕尔库埃

阅读全文
技术实践

如何利用vLLM来扩展大语言模型在AI智能体中的应用范围

在本教程中,我将向您展示如何使用vLLM来优化大型语言模型的推理性能,从而提升AI代理的工作效率。我会帮助您理解大型语言模型推理的原理,分析为什么AI代理的任务会引发GPU调度和内存压力问题,并探讨vLLM是如何被设计出来以提高处理能力的。 接下来,我们将运行一台本地的vLLM服务器,并通过其兼容OpenAI的API,使用AI代理与它进行连接。 目录 背景知识 先决条件 什么是大型语言模型推理? 大型语言模型推理如何利用CPU和GPU 为什么AI代理的任务难以处理 vLLM是如何为AI代理任务提供支持的 设计动机与架构 步骤1:安装vLLM 步骤2:启动vLLM服务器 步骤3:将AI代理连接到

阅读全文