谷歌发布的 Gemma-3 模型,拥有 270 百万种变体。该模型专为在移动设备和边缘设备上进行函数调用而优化设计。
FunctionGemma是Gemma 3 270M模型的轻量级版本。该模型经过 … Read More
Socrates
FunctionGemma是Gemma 3 270M模型的轻量级版本。该模型经过优化,能够将自然语言转化为结构化的函数和API调用,从而让AI代理不仅能“说话”,还能“行动”。
几个月前推出的Gemma 3 270M已经升级为FunctionGemma,因为它具备了处理函数调用的能力,以满足开发者的需求。
在本地运行时,该模型可以作为独立的智能体来处理一些私密的、离线的任务,或者作为“智能交通控制器”,将复杂的请求转发给更大的远程模型来处理。
在设备上运行时,该模型可以自动化复杂的多步骤流程,比如设置提醒或切换系统设置等。为了实现这一点,模型必须足够轻便,以便可以在本地运行,同时还需要具备足够的可靠性。
FunctionGemma并非用于零样本训练,而是被设计成一种可以快速定制、适用于设备的智能体。它可以将自然语言转化为可执行的API操作,从而实现生产级性能。
在我们的“Mobile Actions”评估中,通过微调后,模型的可靠性得到了提升,准确率从58%提高到了85%。
该模型能够在资源有限的设备如手机和NVIDIA Jetson Nano上高效运行。它利用Gemma的256k词汇量来高效地解析JSON和多语言输入。
FunctionGemma支持所谓的“统一动作和聊天”功能,它可以生成结构化的代码/函数调用来执行工具,然后再次使用自然语言来解释结果。
谷歌还指出,FunctionGemma拥有广泛的生态系统支持,可以与Hugging Face Transformers、Unsloth、Keras或NVIDIA NeMo等框架一起使用,也可以通过LiteRT-LM、vLLM、MLX、Llama.cpp、Ollama、Vertex AI或LM Studio等进行部署。
谷歌明确指出了使用FunctionGemma的条件,包括拥有明确的API接口、愿意对其进行微调、优先考虑本地化部署,或者构建能够结合本地设备和远程任务的复杂系统。
为了展示该模型的实际应用效果,谷歌发布了多个演示示例,包括Mobile Actions、TinyGarden和Physics Playground。这些演示都可以通过Play Store上的Google AI Edge Gallery应用程序访问。
Mobile Actions可以解析诸如“为明天午餐创建一个日历事件”、“将John添加到我的联系人列表中”或“打开手电筒”之类的自然语言命令,并将其映射到相应的操作系统级别的工具调用。
TinyGarden是一个由语音控制的游戏,玩家可以使用自然语言命令来操控游戏中的模拟行为。该模型会将这些命令分解为具体的函数调用,例如plantCrop和waterCrop,并指定具体的坐标目标。
Physics Playground则是一个互动式的物理谜题演示,用户可以使用自然语言指令来控制游戏中的模拟行为。这个演示使用了Transformer.js来展示客户端JavaScript的集成方式。
FunctionGemma可以在Hugging Face或Kaggle上找到。谷歌还提供了Colab笔记本以及mobile-actions数据集,以帮助开发者更好地使用该模型。
相关文章
OAuth 2.0的工作原理:后端开发人员的实用指南
如果你问十位初级开发人员OAuth 2.0的原理,其中九个人会开始列举诸如“授权服务器”、“承载令牌”、“PKCE”和“隐式授权”之类的术语。他们还可能会画出一张包含六条来回箭头的序列图。 但当你问他们为什么会有某个特定的HTTP请求存在,或者如果去掉这个请求会发生什么问题时,他们往往无法给出合理的解释。 在我看来,这是因为人们通常是以逆向的方式来学习OAuth的。大多数教程都是先介绍定义和序列图,然后再解释为什么该协议会被设计成这样的结构。 在本书中,我们将改变这种教学方式。我们会从实际工程问题出发,逐步构建OAuth 2.0的概念体系,从而自然地理解这一协议的运作原理。当我们开始使用Spr
阅读全文