先认三个词
badcase:AI 答错的那一条实例
回归测试:拿旧题重考一遍,看有没有考砸
灰度:先放给一小撮用户试,出事只影响这一小撮
一、面试现场
面试官提问
“给客服 AI 提示词加了句‘必须谨慎’,客诉为什么反而多了?”
客服 AI 被抓到越权——用户问“退款多久到账”,它直接回“我帮您申请自动退款,24 小时内到账”,而你们根本没有这个流程。你连夜加了句“必须谨慎”,第二天客诉反而多了。这就是 Kimi 面试官甩给你的场景。
先放结论:“必须谨慎”是无条件规则,没有触发条件,压住的是所有回答。
第二天的客诉印证了这一点:吵上来的大多不是越权,是推诿——用户问最普通的“退款政策是什么”,模型开口就是“建议您转人工”。一个 badcase 摁下去,正常问答跟着塌。
所以真正要补的是一道回归:改之前先把旧场景跑一遍,退化了就退回上一版。
二、大多数人怎么答的
最常听到的答法
“prompt 改得很小,直接上线观察。”
这话在低风险文案或内部工具里是成立的,退化了最多是几个同事在群里抱怨两句。
换到面向用户的 AI 功能上就不一样了:一句 prompt 会改变大量旧行为,尤其是拒答、谨慎、引用、工具调用这类系统级规则,单点修复可能变成全局退化。没跑过回归的 prompt diff,和没跑过测试的代码是同一种东西——只是它长得像文案,容易被放过去。
三、深度解析
有个几乎同款的复盘案例(已脱敏):另一个客服 AI 团队也越权承诺过退款,第一反应同样是连夜加“必须谨慎”。当晚真正卡住他们的是:改完怎么知道没碰坏别的。后来固定成三个问题:改了哪一句、哪些旧行为不许变、坏了怎么退。
**改了哪一句:**只贴变化句(- 可直接答复;+ 必须谨慎),整段甩过去没人分得出你动了哪里
**哪些旧行为不许变:**正常的退款政策解释不能跟着变保守
**坏了怎么退:**这次改动记成 v8,出事一键退回 v7
最容易糊弄的是第二个。“不许变”得写成具体的旧行为,写“别变差”等于没写。“必须谨慎”听着稳妥,是因为它没有触发条件;换成“可引用公开政策,不得代替人工确定金额”这种带触发条件的写法,边界就窄得多,谨慎才不会泛滥到所有问答。
三个问题答不上来,换我会把改动先压一压——说明还没搞清楚这句话会碰到哪些旧行为,推上去就是在赌。
还有一件事顺手做:把 prompt 版本号写进 trace(每次回答的运行留痕),下次复盘 badcase 才知道是哪一版规则让它这么答的。这条是他们吃过亏才补的:早期 trace 只存输入输出,翻到离谱回答,说不清当时线上跑的是哪一版。
四、面试官追问链
追问会盯住“prompt 很难 diff”和“热更新要不要 review”,我认为都能落回版本和回归上答。
追问 1
prompt 很难 diff 怎么办
把系统提示、任务提示、示例和规则拆成四段分开存,变更只动一段,diff 就从“整篇变了”缩成“规则段第 3 条改了”。没拆之前评审要通读一千多字才敢点通过,结果就是没人真读完。
追问 2
回归样本要多少
从关键路径开始,宁可少但稳定。那个团队一开始把四百多条历史 badcase 全倒进去,一轮四十多分钟没人看完;砍到 30 条上下才真的天天跑得起来。一半是历史 badcase,一半是正常问答,后一半才是发现退化的主力(匿名项目示意口径)。
追问 3
prompt 能不能直接热更新
能,但至少要留版本号、回滚入口和改动人记录。他们早期直接改线上配置不留痕,出事那天 trace 只看得到模型答错了,翻不出是哪一版规则,最后靠人回忆才定位到那次热更新。
五、实战场景
那次修复没有直接上线:先拆出 prompt diff,再拿 30 条旧场景跑回归,跑完才决定放量。三天的经过按顺序摆出来,最有意思的是第二天(已脱敏,通过率为复盘示意口径)。
第 1 步 · 当天下午,只绑一条 badcase
改动只挂在 case_418 这一条上,顺手想加的其它规则全部挪到下一次。
diff 只剩 1 句,规则段之外 0 改动
第 2 步 · 第二天上午,30 条旧样本跑一轮
跑回归的是当天值班的工程师,特意避开改 prompt 的人。一轮跑完,最先炸的不是越界样本,是“退款要几天到账”这种最普通的政策解释——模型把“说明规则”也当成了“承诺赔付”。
政策解释类通过率 87% → 63%,退化了 24 个点
第 3 步 · 第三天,改窄规则再放 10%
规则改成“可引用公开政策,不得代替人工确定金额”,先放 10% 会话跑两天,版本号跟着 trace 落库;每天扫一遍新进 badcase,没有新类型再放全量。
正常场景恢复到 84%,越界样本继续被拦
回头看,起作用的只有一件事
放量之前先跑了那 30 条旧场景。要是当天直接推全量,24 个点的退化会在两三天后以客诉的形式回来,而且没人会第一时间联想到那句“必须谨慎”。
六、本课总结
一句话总结
改 prompt 前先跑一遍旧场景,退化了就退版本——这比任何变更流程都管用。
面试锦囊
**先说:**prompt 改一行也要走回归,它是会影响系统行为的配置代码,不是文案。
**再说:**改之前回答三个问题——改了哪一句、哪些旧行为不许变、坏了怎么退。
**最后:**热更新不等于免 review,至少留版本号和回滚。
改一行 prompt,你会先跑 30 条旧场景回归,还是直接上线观察?
学AI大模型的正确顺序,千万不要搞错了
🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!
有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!
就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋
📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇
学习路线:
✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经
以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!
我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~