Langfuse:开源 LLM 可观测性与评估平台实战指南
·
1. 什么是 Langfuse
Langfuse 是一个开源的 LLM 可观测性与评估平台,用于追踪、监控和调试基于大语言模型的应用。它帮助开发者记录每一次 LLM 调用的输入输出、Token 消耗、延迟和成本,并提供数据标注、在线评估与提示词管理能力。
2. 核心功能
Langfuse 主要提供以下能力:
- 追踪(Tracing):记录完整的调用链路,包括 Prompt、模型响应、工具调用和中间步骤。
- 评估(Evaluation):支持人工标注和自动化评估,可对接 LLM-as-a-judge 等方案。
- 成本与延迟监控:按模型、用户、会话维度统计 Token 消耗、费用和响应耗时。
- 提示词管理:版本化管理 Prompt 模板,支持线上快速切换与回滚。
- 数据集与测试:沉淀真实样本,用于回归测试和模型对比。
3. 快速开始
Langfuse 提供云服务和自托管两种方式。自托管时,推荐使用 Docker Compose 一键启动服务端,然后在应用中安装对应 SDK 完成接入。
git clone https://github.com/langfuse/langfuse.git
cd langfuse
docker compose up -d
启动后,在项目设置中创建 API Key 和 Public Key,即可在代码中初始化客户端。
4. 接入示例
下面以 Python 为例,演示如何在应用中初始化 Langfuse 并记录一次 LLM 调用。
from langfuse import Langfuse
langfuse = Langfuse(
public_key="pk-xxx",
secret_key="sk-xxx",
host="http://localhost:3000"
)
trace = langfuse.trace(name="my-trace")
generation = trace.generation(
name="chat-completion",
model="gpt-4o",
input={"messages": [{"role": "user", "content": "你好"}]},
output={"content": "你好,有什么可以帮你?"}
)
generation.end()
trace.update()
5. 在 LangChain 中使用
Langfuse 提供了与 LangChain 的官方集成,通过回调处理器即可自动记录链路信息,无需手动埋点。
from langfuse.callback import CallbackHandler
from langchain_openai import ChatOpenAI
langfuse_handler = CallbackHandler(
public_key="pk-xxx",
secret_key="sk-xxx",
host="http://localhost:3000"
)
llm = ChatOpenAI(model="gpt-4o")
response = llm.invoke("介绍一下 Langfuse", config={"callbacks": [langfuse_handler]})
6. 数据评估与标注
Langfuse 支持在 Web 界面中对 Trace 进行人工标注,也可以编写评估函数自动打分。评估结果会关联到对应的 Trace 和 Generation,便于后续分析模型质量。
7. 总结
Langfuse 是构建生产级 LLM 应用的重要基础设施。通过完整的调用追踪、成本监控和评估能力,它能够显著提升应用的可观测性和迭代效率,适合从原型验证到线上运营的各个阶段。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)