1 LangSmith概述
- LangSmith 是LangChain 生态系统中专门用于LLM(大语言模型)应用调试、监控、评估和管理的平台。
- 🔍追踪(tracing):记录每次LLM 调用的详细信息
- 📊监控(monitoring):实时查看应用性能
- 🐛调试(debug):排查问题和优化性能
- 📈评估(evaluate):系统化测试LLM 应用
2 具体功能
2.1 Tracing(追踪)
- 功能:这是LangSmith 最核心的功能。它会完整记录你大模型应用的每一次调用链路(Trace)。
- 作用:当你的Agent(智能体)或RAG 系统运行变慢或报错时,点击进入对应的项目,你可以看到每一步具体的Prompt 是什么、模型返回了什么、消耗了多少Token,以及每一个链条节点的耗时,非常方便排查Bug 和优化性能。
2.2 Monitoring(监控)
- 功能:提供生产环境的高级数据可视化看板。
- 作用:帮你从宏观角度监控应用在一段时间内的运行状况。你可以看到Token 消耗趋势、QPS(每秒请求数)、错误率、平均延迟(Latency)以及成本预估。适合应用上线后观察系统的稳定性和开销。
2.3 Datasets & Experiments(数据集与实验)
- 功能:用于管理测试数据集并运行对比实验。
- 作用:你可以把用户的真实输入、特定的边界情况(Edge Cases)存为数据集。当你修改了Prompt 或更换了底层大模型时,可以在这里运行自动化对比测试,直观看到新旧版本在同一批测试集上的表现差异。
2.4 Evaluators(评估器)
- 功能:配置和自动化评估任务。
- 作用:大模型的输出往往难以用传统的断言(Assert)来测试。这里允许你配置基于规则(如关键词匹配)或基于模型(LLM-as-a-judge)的评估指标(如:答案相关性、是否包含幻觉等),对追踪到的数据或实验结果进行自动打分。
2.5 Annotation Queues(标注队列)
- 功能:人工反馈与数据清洗工具。
- 作用:在应用开发或初上线阶段,你可以把一部分痕迹(Traces)发送到标注队列中,让团队中的核心成员、业务专家或人工客服进行手动打分、纠正回答或贴标签,这些高质量的人工标注数据后续可直接用于微调模型或充当测试集。
3 登录注册
- LangSmith官网
- 先使用选择谷歌或者Github账户注册
- 注册登录后,先选择Settings,添加一个API_Key
- 创建API_Key,创建好后拷贝保存好。
- 接下来在
.env配置文件中,添加环境变量-
# 是否启用Langsmith监控功能 LANGSMITH_TRACING=true # Langsmith监控WebUI地址 LANGSMITH_ENDPOINT=https://api.smith.LangChain.com # 创建的API_KEY LANGSMITH_API_KEY=<YOUR_API_KEY> # 自定义项目名称,可以在Langsmith WebUI监控页面根据名称查看对应的运行记录 LANGSMITH_PROJECT="pr-clear-harmony-32"
-
- 然后写一段代码运行
-
import os from dotenv import load_dotenv from langchain_deepseek import ChatDeepSeek # 读取.env配置 load_dotenv(override=True) DEEPSEEK_API_KEY = os.getenv('DEEPSEEK_API_KEY') DEEPSEEK_BASE_URL = os.getenv('DEEPSEEK_BASE_URL') # 模型初始化 llm_deepseek = ChatDeepSeek( api_key=DEEPSEEK_API_KEY, api_base=DEEPSEEK_BASE_URL, model="deepseek-v4-flash", ) # 模型调用 response = llm_deepseek.invoke("请介绍下自己") print(response.content)
-
- 刷新下页面,就可以看到我们本地的项目了
- 点击进去,就可以看到具体的交互信息






- LangSmith基本使用&spm=1001.2101.3001.5002&articleId=164880390&d=1&t=3&u=019942cdf01446d3b601fc76c6723181)
4876

被折叠的 条评论
为什么被折叠?



