Expedia利用由人工智能驱动的服务遥测分析工具来加快事故调查的速度。
Expedia集团推出了STAR这一内部开发的、由人工智能辅助构建的观测平台。该平台能够帮助工程师利用服务遥测数据以及大语言模型来调查各类生产故障。STAR基于FastAPI、Datadog、Celery、Redis和Langfuse等技术构建而成,它遵循结构化的工作流程来分析遥测数据、生成根本原因分析报告,并为事故应对工作提供支持,同时确保工程师能够及时获取相关进展信息。 作者:Leela Kumili

Expedia集团推出了STAR这一内部开发的、由人工智能辅助构建的观测平台。该平台能够帮助工程师利用服务遥测数据以及大语言模型来调查各类生产故障。STAR基于FastAPI、Datadog、Celery、Redis和Langfuse等技术构建而成,它遵循结构化的工作流程来分析遥测数据、生成根本原因分析报告,并为事故应对工作提供支持,同时确保工程师能够及时获取相关进展信息。
作者:Leela Kumili相关文章
演讲主题:克劳德能够自我修复吗?利用大型语言模型进行事件响应
人类可靠性工程师亚历克斯·帕尔库埃分享了关于如何利用大语言模型来应对现实世界中的突发事件的相关经验。他解释了为什么人工智能在分析日志和追踪数据时能够发挥“超人般”的作用,为何在根本原因分析过程中,它仍然难以区分因果关系与相关性,以及工程领域的领导者该如何将人工智能融入到应急响应的工作流程中,同时避免削弱人类的专业能力。 作者:亚历克斯·帕尔库埃
阅读全文
大规模产品实验:Airbnb、Netflix、Lyft和Uber是如何针对基于大语言模型的AI功能进行因果分析的
对于基于大语言模型的AI功能而言,因果推断已不再是理论上的概念。Airbnb、Netflix、Lyft和Uber都发布了详细的工程博客文章,详细说明了他们是如何衡量产品变更对用户行为的因果影响的。 他们所使用的技术方法(如差异分析法、回归不连续性分析以及双重稳健估计等)都是标准工具。 值得关注的是,这些团队是如何在大规模应用中运用这些技术的:在哪些情况下这些方法在实际操作中会失效,他们又是如何通过补充措施来确保估算结果的可靠性,以及他们是如何将这些数据与实际的产品决策联系起来的。 如果你正在开发基于大语言模型的功能,并且是根据用户点赞率和会话时长来做出产品决策的,那么这些文章一定会改变你对测量
阅读全文
什么是代理框架?Claude Code、DeepSeek Harness以及Hermes Agent背后的架构原理是什么
2026年8月13日,DeepSeek在GitHub上发布了一个名为 deepseek-harness 的仓库。仅仅两天后,这个仓库就获得了95,386个星标和8,826次分支请求——这一数字本身虽然算不上什么具有实际意义的指标,但如此迅速的增长速度显然说明其成功并非偶然。在2026年,这款开发工具在GitHub上的增长速度堪称最快的之一(例如 Flowtivity 和 deepseek-ai/deepseek-harness )。 九个月前,一位名叫Mario Zechner的奥地利工程师发布了一个完全相反的产品:一款名为Pi的编程辅助工具,它仅配备了四项内置功能,除此之外几乎没有其他附加组
阅读全文
如何构建一个具备自我评估功能的人工智能系统:为大型语言模型应用开发自动化测试与评估流程
你将自己的AI功能部署出去,演示效果也确实不错,团队成员们都感到非常满意。然而,当有用户提出一些超出测试范围的问题时,模型却会给出完全错误的回答。 使用大型语言模型进行开发的现实是:传统的软件测试方法根本行不通。当你的系统每次运行都会生成不同的输出结果时,你根本无法使用“output == expected”这样的简单判断语句来进行测试。 大多数教程都会教你如何构建聊天机器人或设置RAG评估流程,但之后就戛然而止了。它们只会告诉你“将其部署到生产环境中”,仿佛最困难的部分已经结束了。但实际上,真正关键的是要判断你的AI模型是否真的有效,以及在它性能下降时及时发现这个问题。 在这篇文章中,我会带
阅读全文