演讲主题:那些质量较高的300个代币,远胜那些数量众多但质量低劣的10万个代币——这就是“情境工程”的架构所在。
Baruch Sadogursky和Patrick Debois探讨了为什么编码代理会因为过大的上下文窗口以及过于冗长的提示信息而失效。他们介绍了一些实用的解决方案,包括延迟加载技能、为上下文数据添加版本标识、使用外部存储系统来保存数据,以及利用大语言模型来进行评估。软件架构师与工程团队负责人将了解到如何将原始的Markdown文件转化为高效、可靠的代理工作流程。 作者:Patrick Debois, Baruch Sadogursky

Baruch Sadogursky和Patrick Debois探讨了为什么编码代理会因为过大的上下文窗口以及过于冗长的提示信息而失效。他们介绍了一些实用的解决方案,包括延迟加载技能、为上下文数据添加版本标识、使用外部存储系统来保存数据,以及利用大语言模型来进行评估。软件架构师与工程团队负责人将了解到如何将原始的Markdown文件转化为高效、可靠的代理工作流程。
作者:Patrick Debois, Baruch Sadogursky相关文章
如何从大型语言模型中获取可靠的结构化数据
大多数关于如何调用语言模型的教程都会在 JSON.parse(response.content) 这行代码处结束。这段代码在处理前十个测试用例时确实可以有效运行。但当你开始实际应用时,会在第400次左右的一次请求中遇到问题:模型可能会返回一个它自己编造出来的日期,或者当你的数据结构应该包含5个元素时却返回8个数组项,又或者返回一个格式完全正确但实际上缺少某个字段的JSON对象。 我在开发Temploracraft这个简历工具时遇到了这样的问题。这个工具会接收用户上传的文档,并将其转换成应用程序可以编辑的结构化数据。 输入的数据确实具有很大的不可预测性:有些是两列结构的PDF文件,有些表格其实并
阅读全文
大规模产品实验:Airbnb、Netflix、Lyft和Uber是如何针对基于大语言模型的AI功能进行因果分析的
对于基于大语言模型的AI功能而言,因果推断已不再是理论上的概念。Airbnb、Netflix、Lyft和Uber都发布了详细的工程博客文章,详细说明了他们是如何衡量产品变更对用户行为的因果影响的。 他们所使用的技术方法(如差异分析法、回归不连续性分析以及双重稳健估计等)都是标准工具。 值得关注的是,这些团队是如何在大规模应用中运用这些技术的:在哪些情况下这些方法在实际操作中会失效,他们又是如何通过补充措施来确保估算结果的可靠性,以及他们是如何将这些数据与实际的产品决策联系起来的。 如果你正在开发基于大语言模型的功能,并且是根据用户点赞率和会话时长来做出产品决策的,那么这些文章一定会改变你对测量
阅读全文
在大型语言模型应用中,当你的两个模型都出现错误时,如何通过双重鲁棒性估计方法来进行产品测试与优化?
六个月前,你们推出的这款人工智能产品开始采用“用户主动选择参与”的模式。你们进行了倾向性分析,并考虑了用户的参与程度以及查询的准确性等因素,最终发现任务完成率确实提高了8个百分点。这一数据被纳入了季度业务报告中,大家都对此感到满意。 然而,严谨的数据科学家难免会提出一些棘手的问题:你们有多确定这个倾向性模型已经考虑到了所有可能影响结果的因素?如果遗漏了某些因素,那么逻辑回归模型得出的选择概率就会不准确;又或者,如果结果回归模型的设定本身就有误——因为任务完成率与查询准确性之间的关系并非线性的,线性模型根本无法准确反映这一关系——那又会怎样呢? 你们有两个模型,但并不确定哪个是正确的,而这两个模
阅读全文
演讲主题:为人工智能代理构建数据层:从事务系统到多中心处理架构及语义模型
Fabiane Nardon介绍了TOTVS是如何为那些对大量数据“渴求不已”的AI系统准备企业数据的。她探讨了如何在精确性、安全性与成本之间平衡确定性逻辑与非确定性大语言模型。Nardon还详细说明了如何通过使用数据网格、低延迟数据库架构、语义本体以及动态的工具选择机制,来优化上下文窗口的设计,并减少事务系统中因数据处理而产生的开销。 作者:Fabiane Nardon
阅读全文