角色
创始工程师——负责 RAG 管道、评测体系、提示词系统与前端。
发布于
2025 — 至今
- Python
- FastAPI
- pgvector
- Claude API
- Next.js
成果
- -52% 首次响应时间
- 94% 答案采纳率
- 4 万 每月生成草稿数
大多数 AI 副驾死于同一种方式:自信地胡说八道,一个月内耗尽团队信任。Lumen 反着来——一个更慢、但可引用、可验证的答案,胜过又快又顺口的猜测。
架构
核心是一条为客服对话(而非通用问答)调优的检索增强管道:
- 有据生成。 每条草稿都标注它引用的原始文档段落,客服能看到内联来源;检索不到时,系统直接说”不知道”,绝不即兴发挥。“我不知道”是功能,不是缺陷。
- 评测体系。 我建了一套离线评测集:600 条真实历史工单 + 标准答案。每次改提示词或换模型,都要先在事实准确性、语气、引用质量上打分,合格才上线——拒绝凭感觉发版。
- 语气迁移。 系统以每位客服自己的历史回复为风格参照,草稿听起来像”这个团队”,而不是一个聊天机器人。
- 人在回路。 没有自动发送。客服编辑、确认或重新生成。日志显示客服保留了 Lumen 约 94% 的措辞,但几乎每条草稿都会手工微调——这正是我们设计的协作模式。
成果
在一个 200 人规模的客服团队中,首次响应时间下降 52%。更重要的是,新人客服的上手周期从几个月缩短到几周——因为系统本身就是一个活的培训语料库,而不只是自动补全。
如果重来
我会更早做评测体系。上线第一个月没有评测的提示词调优,本质上是把猜测包装成进展。