Zepto用MLflow构建AI客服:评估驱动的实践指南

快速增长下的客服难题
Zepto作为印度快速崛起的即时配送平台,面临海量客户咨询带来的压力。即时配送(Quick Commerce)是近年来兴起的零售模式,承诺在10-30分钟内将商品送达消费者手中。这种模式对客服系统提出了极高要求:订单状态查询、配送延迟投诉、商品缺货替换等问题需要即时响应。传统的工单系统或24小时回复机制完全无法满足需求,任何延迟都可能导致用户流失。印度市场的特殊性还在于多语言环境(印地语、泰米尔语等)和价格敏感度,使得客服系统既要高效又要成本可控。
业务规模扩张下,传统人工客服难以满足实时响应需求。如何用AI技术提升效率的同时保证服务质量,成为核心挑战。与许多企业追求部署速度不同,Zepto选择了"评估优先"的技术路线——在系统上线前建立完善的评估体系,让AI Agent的每次迭代都能被量化衡量,在可靠性和性能间找到平衡点。

技术架构设计
平台与工具选型
Zepto的AI客服系统基于Databricks平台构建,充分利用其数据湖和计算能力。Databricks是基于Apache Spark的统一数据分析平台,最初由Spark创始团队创建。其核心优势是将数据湖(Data Lakehouse)架构与机器学习工作流深度整合。平台提供Delta Lake存储引擎实现ACID事务支持,Photon查询引擎加速数据处理,以及自动扩展的计算集群。对于AI应用而言,Databricks的独特价值在于打通了数据准备、特征工程、模型训练和推理服务的全链路,避免了传统架构中数据在多个系统间搬运的开销。
MLflow作为模型管理核心,贯穿模型生命周期全流程——实验跟踪、模型注册到生产部署。MLflow是开源的机器学习生命周期管理平台,包含四大核心组件:Tracking(实验跟踪)记录每次训练的参数、指标和产出物;Projects定义可复现的运行环境;Models提供标准化的模型打包格式,支持多框架部署;Registry实现模型版本控制和阶段管理(开发/预发/生产)。在AI Agent开发中,MLflow解决了关键痛点:研究人员可能尝试数百种提示词和参数组合,没有系统化追踪就会陷入'哪个版本效果最好'的混乱。
这一选型的核心优势:数据处理、模型训练和推理服务在统一平台完成,大幅降低系统复杂度。企业无需维护独立的数据仓库、训练集群和推理服务,显著降低基础设施复杂度。Databricks的分布式计算能力让团队能快速处理海量历史对话数据,提取高质量训练样本。
评估驱动的工作流程
"评估优先"体现在每个开发环节。模型选择阶段,Zepto并非直接采用参数量最大的模型,而是针对业务场景设计多维度评估指标:响应准确率、意图识别精度、对话完成率和平均处理时长。
每个候选模型都在真实客服数据集上全面测试。MLflow的实验跟踪记录每次实验的详细参数和指标,使团队能系统性比较不同模型和提示词策略的效果。MLflow的实验对比界面让团队能直观比较不同配置,而模型注册表则确保生产环境运行的始终是经过验证的版本,避免实验代码意外上线。这种用数据驱动决策的方法,避免了主观判断偏差。
从实验到生产的关键实践
打造高质量评估数据集
评估体系的基础是优质标注数据。Zepto从历史客服对话中筛选数千条典型案例,覆盖订单查询、退款申请、配送问题等常见场景,每条样本经人工审核确保准确性。
这个过程为模型优化奠定基础。有了标准化评估集,团队能快速验证模型或提示词改动是否真正提升性能,而非只在特定案例上表现更好。
自动化与人工的协同机制
AI Agent并非完全替代人工,而是建立分层处理机制。系统根据置信度评分,将高置信度简单问题自动处理,低置信度或复杂问题转接人工。置信度评分是AI系统判断自身回答可靠性的内在机制。大语言模型在生成回答时,会为输出的每个token计算概率分布。通过聚合这些概率(如使用平均对数概率或熵值),可以得到整体置信度评分。高置信度(如>0.85)通常意味着模型在训练数据中见过大量类似案例,回答更可靠;低置信度则表明问题可能超出模型能力范围或存在歧义。实践中,企业会根据业务容错度设置阈值:订单查询等事实性问题可设置较高自动化阈值,而退款决策等需要判断的场景则保守转人工。这种机制本质上是让AI'知道自己不知道',避免生成错误信息(幻觉)带来的负面影响。
MLflow的模型监控功能实时追踪这一比例,平衡自动化率和服务质量。生产环境中,Zepto持续收集用户反馈和人工纠正数据,定期更新评估数据集。这种闭环反馈让AI系统不断学习新模式,保持长期性能稳定。
业务成果与经验总结
可量化的价值提升
通过评估驱动的AI客服系统,Zepto实现了显著成果:客服响应速度提升60%,人工处理量下降40%,客户满意度保持高位。更重要的是,系统可扩展性让Zepto能在业务高峰期快速调配资源,无需大规模招聘。
MLflow的模型版本管理能力支持安全的A/B测试。A/B测试是互联网产品常用的实验方法,在AI模型部署中同样关键。具体做法是:将线上流量按比例分割,如90%使用当前生产模型(对照组),10%使用新模型(实验组),通过对比两组的关键指标(响应准确率、用户满意度、转人工率等)来评估新模型效果。MLflow等工具能追踪不同模型版本的实时表现,一旦发现实验组指标下降,可立即回滚。新模型上线前先在小流量验证,确认无误后全量推广。相比直接全量替换,A/B测试的优势在于:在真实流量下验证,发现实验室测试无法覆盖的边界情况;限制影响范围,即使新模型有问题也只影响小部分用户;积累足够样本量后再决策,避免凭直觉判断。这种渐进式部署策略大幅降低生产事故风险,在大规模AI系统中是标准实践。
可复制的实践方法论
Zepto的实践证明,"评估优先"不仅是技术理念,更是产品思维。在AI应用快速迭代的环境下,系统性评估能力决定企业能否从技术投入中获得可持续价值。
对希望构建类似系统的企业,关键启示包括:优先投资评估基础设施而非急于上线;选择能统一数据和模型管理的平台降低复杂度;建立实验到生产的完整工具链;持续关注真实业务场景,而非盲目追求技术先进性。
持续演进的方向
随着大语言模型技术演进,Zepto的AI客服系统仍有优化空间。多模态能力引入(如图片识别订单问题)、更精细的情感分析、跨语言支持都是潜在方向。
但无论技术如何变化,评估驱动的核心原则将持续指导系统演进。只有建立在可靠评估之上的AI应用,才能在生产环境真正发挥价值。Zepto的经验为行业提供了可复制、可验证的最佳实践范例。
核心要点
相关推荐

vLLM Worker侧GPU KV Cache初始化流程深度解析
深入解析vLLM推理引擎中Worker侧KV Cache的物理显存分配机制,详解KVCacheConfig从生成到消费的完整流程,包括逻辑block到物理显存的映射原理、ModelRunner的分配策略及混合注意力层的存储设计。

伊朗在霍尔木兹海峡捕获美国潜航器:事件全解析
伊朗宣布在霍尔木兹海峡捕获美国海军水下无人潜航器,引发全球关注。本文深度分析事件经过、水下无人系统战略价值、美伊地缘博弈背景及对全球能源安全和军事格局的潜在影响。

OpenAI用编程智能体加速AI研究:实验效率提升数倍
OpenAI披露内部正使用编程智能体重塑AI研究流程,实验迭代速度提升数倍。本文解读编程智能体如何改变研究范式,以及AI行业密集更新背后的竞争逻辑。