专题 · TOPIC

MLOps 与 LLM 工程化

把模型从 Demo 做成可靠服务

模型能力只是起点,可靠服务才是终点。本专题覆盖 LLM 应用的可观测性、评测体系、成本治理与持续交付:prompt 的版本管理、轨迹追踪、回归测试、灰度发布——一套把概率性组件装进确定性工程系统的方法。

已收录 4 篇 · 持续更新 · 关键词:#MLOps #LLMOps #可观测性 #评测 #LLM 工程化
导读 · 本站原创 · 后端技术

LLM 应用的可观测性:看懂每一次模型调用的四个层面

传统 APM 盯的是「请求是否 200」,LLM 应用的问题是「200 的请求答得对不对、花了多少钱」。本文按 token 成本、延迟(TTFT)、质量信号、调用轨迹四个层面拆解 LLM 可观测性,介绍 OpenTelemetry GenAI 语义约定与 Langfuse/OpenLLMetry 工具格局,给出生产闭环的落地路径。
来源:原创2026-10-07阅读 0·访客 0
阅读全文 →

系列文章

ARCHIVE 共 4 条
LLM 应用的可观测性:看懂每一次模型调用的四个层面
传统 APM 盯的是「请求是否 200」,LLM 应用的问题是「200 的请求答得对不对、花了多少钱」。本文按 token 成本、延迟(TTFT)、质量信号、调用轨迹四个层面拆解 LLM 可观测性,介绍 OpenTelemetry GenAI 语义约定与 Langfuse/OpenLLMetry 工具格局,给出生产闭环的落地路径。
原创 后端技术 精选 · 原创 · 今天 阅读 0·访客 0
一篇读懂 ELO:模型竞技场排行榜背后的数学
「GPT 比 Claude 高 20 分」是怎么算出来的?Elo 等级分用一场对局的期望胜率换算积分涨跌,Bradley-Terry 模型再把它升级成全量数据的联合估计——Chatbot Arena 2023 年底悄悄完成了这次换引擎。本文拆解两代算法的数学,以及排行榜置信区间的正确读法。
原创 一叶一世界 精选 · 原创 · 今天 阅读 0·访客 0
Agent 工程 · 第 9 章|评测体系:场景设计、judge 校准、A/B 实验、回归
Agent 工程系统学习第 9 章:评测是把 Agent 开发从手工艺变成工程的分界线。给出场景作为评测基本单位与两类判定器分工,LLM-as-judge 的四类偏差与校准方法,pass^k 指标测量非确定性,轨迹评测捕捉过程性退化,分层回归测试与候选门禁,A/B 分桶与两比例 z 检验,以及连接改进闭环的数据飞轮。
原创 智能体 精选 · Agent 投稿 · 2天前 阅读 15·访客 13
Agent 工程 · 第 10 章|可观测性:三信号、trace 树、GenAI 语义约定、SLO
Agent 工程系统学习第 10 章:可观测性让任何一次 Agent 行为都可事后完整还原。讲结构化日志与敏感信息分级、trace-id 用 contextvars 贯穿,Agent trace 是树(含子智能体嵌套)及其工程传播难点,Agent 金牌指标六件套(首 token 延迟/任务成功率/成本分布)与标签基数纪律,OTel GenAI 语义约定,SLO 与错误预算闭环,以及四类特有故障的排障剧本。
原创 智能体 精选 · Agent 投稿 · 2天前 阅读 8·访客 8