← 返回蜂巢洞察

Meta将其定制硅芯片的应用范围从计算领域扩展到网络领域。

Meta详细介绍了MTIA 300——这是该公司首款专为训练排名与推荐模型而设计的内部加速器。 作者:Matt Foster

Meta详细介绍了MTIA 300——这是该公司首款专为训练排名与推荐模型而设计的内部加速器。

作者:Matt Foster

相关文章

技术实践

创造了现代人工智能的那篇论文:Transformer背后的故事

每次你与现代人工智能模型进行交互时,其实都在使用一种源于2017年那篇名为《注意力才是关键》的研究论文所提出的架构。 我们在freeCodeCamp.org的YouTube频道上发布的最新视频,详细讲述了八位谷歌研究人员是如何着手改进Google Translate的,最终又如何彻底改变了整个科技领域的格局的。 在这一突破性成果出现之前,人工智能领域主要依赖循环神经网络。这类模型会按顺序逐词处理文本,但这带来了两个巨大的障碍: “上下文丢失”:当处理长句或长段落时,模型会忘记开头那些重要的信息。 “训练速度缓慢”:由于需要顺序处理数据,各个步骤无法并行执行,因此即使使用庞大的GPU集群,模型的

阅读全文
技术实践

人工智能论文评述:通过估算数据分布的梯度来实现生成建模

如今,扩散模型已成为最具影响力的生成式人工智能系统之一。它们被应用于从图像合成与编辑到视频生成、科学发现以及多模态内容创作等诸多领域。 尽管这些模型具备令人印象深刻的功能,但其背后的基本原理却出奇地简单:它们从纯粹的噪声开始,逐步将其转化为真实的数据。 然而,这个简单的描述立刻引出了一个更深层次的问题:如果模型仅仅以随机噪声为起点,那么它如何知道在每一步该朝哪个方向发展?是什么让模型判断出某个微小的改变是会让图像变得更真实,还是会让它偏离真实数据的分布范围呢? 2019年,杨 Song和Stefano Ermon提出了一种新的视角,以一种简洁且符合数学原理的方式解答了这个问题。他们的框架并非试

阅读全文
技术实践

如何利用SFT和QLoRA技术为AI代理定制大型语言模型

在本教程中,我将向您展示如何使用QLoRA进行有监督微调,从而优化大型语言模型,使其能够用于AI代理中。这种方法使我们能够对预训练模型进行定制,使其表现出我们期望的行为。我们将采用一种轻量级的训练流程,仅更新模型中的少量参数。 我们会利用Unsloth以及Hugging Face生态系来下载Qwen 1.5B基础模型,然后应用基于QLoRA的有监督微调方法,并将优化后的LoRA适配器权重保存在本地,以便后续进行推理使用。所有操作都在本地完成,因此您无需支付任何模型API的使用费用。 目录 背景知识 什么是有监督微调? 什么是LoRA? 动机与架构 步骤1:安装Python相关依赖库 步骤2:训

阅读全文