读者视角导读
没有路由器的 LLM,只是昂贵的随机数生成器
WP17 导读:企业级 LLM 系统需要在生成之前具备路由、预算、证据和安全边界。
典型的企业级 LLM 集成遵循一条可预测的弧线:团队识别一个用例,选一个模型,写一个 prompt,部署一个 API 包装器。六周后,账单来了。Token 用量是预估的三倍。高峰流量期间的延迟飙升拖累了核心 API 响应时间。一个幻觉产生的房型映射决策传播到了生产搜索结果中。团队先加一个缓存,再加一个重试层,然后加一个 fallback 模型,再加一个预算告警——每个补丁都在解决一个架构从未预见到的症状。
HotelByte 的 LLM 增强智能引擎把这些问题当作架构需求,而非运维事后补救。系统建立在三个基础层之上:基于置信度评分动态选择处理路径的智能路由器;对边界案例应用结构化推理的 LLM 增强器;以及利用多模型编排进行运营分析的智能诊断模块。核心设计原则不是”到处用 LLM”,而是”只在有理由、有边界、可恢复的地方用 LLM”。
工具谬误:把 LLM 当作功能来加
大多数团队把 LLM 集成当作功能叠加:加一个聊天端点,加一个摘要流水线,加一个分类服务。每个功能单独看都有用,但聚合后的系统缺乏治理。没有统一预算。没有跨功能延迟预算。没有共享的证据模式。功能之间没有 fallback 契约。当一个功能超出它的 token 配额时,其他功能会争夺同一个提供商的速率限制。当提供商降级时,每个功能一起降级。
更深层的错误是认识论层面的。LLM 输出是概率生成,不是确定性计算。当一个分类服务返回一个标签时,下游系统把它当作 ground truth。当一个诊断工具返回一个根因时,值班工程师未经独立验证就据此行动。缺乏置信度阈值、证据痕迹和结构化输出模式,意味着平台无法区分高确定性推断和低确定性猜测。
HotelByte 的系统视角:路由、预算、证据、安全
智能路由器是治理平面。它根据基线算法置信度将每个房型映射请求分类到三个通道之一:快速通道(约 80% 请求,<100ms,零 LLM 成本)、混合通道(约 15%,对边界案例选择性 LLM 重评估)和 LLM 通道(约 5%,全面重处理)。这种分层方式确保最昂贵的计算路径只留给最小比例的请求。
路由决策不是启发式猜测。它是基于所有房型组的平均置信度分数和低置信度比例计算出来的。高置信度案例完全通过优化的基线算法解决。LLM 只在概率推理能提供可衡量价值的子集上被调用。这产生了一条随请求量次线性增长的成本曲线——这个性质在流量增长时变得至关重要。
预算治理分三层:单请求上限 $0.50、日限额 $100、月上限 $3,000。当利用率超过任何阈值的 80% 时,系统自动降级到更低成本的模型或回退到缓存结果。预算耗尽触发优雅降级到纯算法路径,服务不中断。这些不是叫醒工程师的告警,而是无需人工干预即可强制执行边界的自动化控制面。
结构化输出作为安全边界
所有 LLM 交互强制执行严格的输出模式。房型映射边界评估器要求包含 ShouldGroup、Confidence、Reason 和 Action 字段的 BoundaryDecision 结构。诊断输出遵循包含 Summary、RootCause、Action 和 Confidence 节的标准化模板。结构化生成消除了自由文本的歧义,并支持自动化下游处理。它还创建了审计痕迹:每个决策都是可检查、可验证、可跨请求比较的。
多模型网关支持 DeepSeek V3.2(默认)、GPT-4o 和 Claude 3.5 Sonnet。模型选择由场景复杂度和当前预算状态指导。如果默认模型不可用或预算阈值接近,系统会无需代码变更就切换到替代提供商。这种多样性缓解了供应商特定故障,防止单一提供商依赖变成系统性风险。
优雅降级是架构内置的,不是临时拼凑的。基线算法对 100% 的请求返回有效结果;LLM 增强严格是附加的。在提供商延迟、超时或预算约束的情况下,系统在毫秒级内回退到 LLM 之前的结果。移除 LLM 组件不会损害核心功能。
白皮书重点阅读路径
如果你在评估 HotelByte 的 AI 运营能力,建议重点阅读以下章节:
- 智能路由器 —— 理解三个处理通道、置信度阈值和次线性成本扩展。
- LLM 增强器 —— 查看批量边界处理、结构化决策输出和成本追踪。
- 智能诊断 —— 审阅 AgentSelector、LogContextBuilder、PPIOChatModel 和 ResultProcessor 组件。
- 预算治理 —— 研究三层上限结构和 80% 利用率时的自动降级。
- 集成策略 —— 比较三种运营模式:边界案例增强、全面 LLM 处理和纯基线算法。
- 已实现控制摘要 —— 审阅完整控制列表,包括 Redis 智能缓存和全面的成本/延迟指标。
完整技术规范见 LLM-Augmented Intelligence Engine 白皮书。中文版:LLM 增强智能引擎白皮书。
全部白皮书索引见 HotelByte Whitepapers。
评论