做投放的团队这几年普遍会遇到一个坎:手里的关键词、素材、落地页越来越多,但用户搜索的词和业务词总是对不上。传统的关键词匹配只能做到字面一致,用户说“性价比高的跑鞋”时,你如果只匹配“跑鞋”这个词,流量和转化都会打折扣。我最早接触AI嵌入服务(Embedding Service)也是为了解决这个痛点,用语义向量把用户query和业务内容映射到同一个空间,靠距离来度量相关性。但搞了一段时间发现,通用嵌入模型在业务场景下效果并不稳定,特别是垂直行业的专业术语、口语化表达、品牌别称,经常让模型“懵圈”。后来才意识到,问题出在数据集上——没有一套贴合自身业务的标注数据集,嵌入服务就永远只是“看起来能用”。
这篇文章就是给投放团队写的一份实操手册,核心讲清楚三件事:怎么搭建一套业务AI嵌入服务的标注数据集,怎么用这套数据让嵌入服务真正贴合业务,以及结合AI搜索优化之后如何把语义能力转化成实打实的转化率提升。内容不涉及复杂的算法推导,全部是可落地的步骤、模板和参数,适合投放运营、增长团队、以及刚接触AI应用的开发者参考。
1. 投放团队自建标注数据集:为什么必须自己做
1.1 通用嵌入模型在投放场景的失灵表现
先说说我踩过的坑。当时我们接了一个开源嵌入模型做商品搜索的语义匹配,模型效果在公开评测集上很好看,但一到业务场景就露馅。比如用户搜“送男朋友的礼物”,我们的商品里有“男士机械手表”,也有“男友风卫衣”,模型给这两个结果的打分竟然差不多。可实际上,从历史转化数据看,“机械手表”在这个query下的转化率是卫衣的5倍以上。问题出在哪?通用模型学的是“送男朋友的礼物”和商品文本之间的通用语义相关性,但投放场景下的相关性必须包含业务知识——比如价格带、性别指向、场景标签、品牌偏好。这些业务知识不在模型的训练数据里,模型自然学不会。
更麻烦的是行业黑话。我们做美妆类投放时,用户搜索“烂番茄色口红”,业务方内部管这个色号叫“枫叶红”。“烂番茄色”和“枫叶红”字面完全不一样,通用模型的向量距离很远,结果就是搜不到该搜的商品。类似的还有“小金条”“斩男色”“姨妈色”这些非标准化口语词。所有这些都指向同一个结论:通用嵌入模型解决不了业务相关的语义理解,必须用标注数据集对模型进行针对性的调优或重训。
1.2 标注数据集在嵌入服务中的真实作用
嵌入服务的本质是给文本学一套向量表达,让语义相近的文本在向量空间里距离更近。那“语义相近”是谁定义的?公开数据集定义的是通用语义,业务标注数据集定义的是业务语义。什么叫业务语义?两个例子你就明白了:
- 通用语义下,“苹果”和“香蕉”距离近,因为它们都是水果;“苹果”和“iPhone”距离很远。
- 业务语义下(针对3C数码投放),“苹果”和“iPhone”必须距离近,因为用户搜“苹果手机”时想买的就是iPhone,而“香蕉”跟业务毫无关系。
标注数据集干的事情,就是把这种“业务认为什么和什么相关”的知识,通过成对的样本注入到嵌入模型里。标注数据告诉模型的不只是“苹果≈iPhone”,更是这类对应关系背后的一整套逻辑——比如品牌词和品类词的映射、场景词对商品属性的约束、口语化表达与标准词表的对应。投放团队手里的竞价关键词、搜索词报告、客服对话记录、商品标题,都可以变成这种标注数据的原材料。数据量不需要大到吓人,质量足够好的几千条到几万条,就能让嵌入服务在业务语义上发生质变。
1.3 什么样的投放业务最需要做这件事
不是所有投放团队都需要立刻上这套方案。我梳理了三个比较典型的信号,如果你中了两个以上,说明自建标注数据集这件事该提上日程了:
| 信号 | 表现 | 原因 |
|---|---|---|
| 搜索词报告里“不相关点击”占比高 | 用户通过品牌词进店,但实际需求是另一个品类 | 字面匹配无法理解query背后的真实意图 |
| 关键词匹配方式被迫从“短语”降级到“广泛” | 匹配方式太紧没量,太松不精准 | 缺少数值化的语义相关性判断依据 |
| 同义改写、长尾词拓词效率低 | 靠人工挖词,一天只能拓几十个词 | 没有语义模型辅助,拓词全靠经验和运气 |
如果只是做精准匹配的头部词投放,现有工具够用,确实可以先不上嵌入服务。但只要你需要靠长尾词、口语化表达、跨品类需求来拿量,标注数据集就是绕不开的投入。
2. 标注数据集的搭建流程:从数据源到规范落地
2.1 数据源清洗:先用历史行为数据自动造一批“种子标注”
很多人一听标注数据集就头大,觉得要手动标注几万条。其实没必要。投放团队手里有大量可以低成本转化成标注数据的原料,关键是要知道怎么用。
首选数据源是搜索词报告和点击日志。用户在搜索框输入query后点选了哪个商品,本身就是一条天然的“相关性正样本”。比如query是“夏季通勤男鞋”,用户点了“飞织透气商务休闲鞋”,这两者就是一对正样本。同理,曝光了但没点击的、或者点击后立即跳出的商品,可以当作弱负样本(不一定是完全不相关,但至少说明匹配度不够好)。用这种方式,不需要任何人工标注,就能造出几万条初始数据。我们当时从系统里导出了近90天的搜索词报告,按“query-商品标题-点击次数”聚合,过滤掉点击次数少于3次的数据,拿到了约1.2万条正样本对。
第二个值得深挖的数据源是客服对话记录。客服接待客户时客户的原始表达,往往比商品标题更口语化。比如“你们家那个蓝色的、夏天穿不热的裤子”,对应的是商品标题“冰丝阔腿裤夏薄款”。从客服记录里提取这种“用户口语描述—最终成交商品”的对应关系,比搜索日志里的数据更加多样化,能显著增强模型的泛化能力。具体做法是拉取客服系统的会话文本,用正则或规则匹配出包含商品链接或SKU编码的会话,再取用户提问的那句话作为query。
还有个容易被忽略的数据源是竞品投放素材。把竞品的广告标题、落地页文案收集起来,用商品标题或业务标准词表去匹配,可以生成跨品牌的语义映射。比如竞品用“办公室提神神器”做卖点,我们业务词表里有“咖啡胶囊”,虽然字面不匹配,但在“提神”语义上是强相关的。当然这部分数据需要人工审核,不能全自动灌入。
2.2 标注规范设计:相关性等级、多语义标签和否定样本
自动造出来的数据只能当“种子”,要形成真正高质量的标注数据集,还得设计一套贴合投放场景的标注规范。我推荐用三级相关性标注,不要搞太细:
- 2分(强相关):query和商品/落地页是同一需求,用户点击后大概率转化。例:query“笔记本散热器”和商品“笔记本底座风扇”。
- 1分(弱相关):只有部分相关性,用户可能会点,但转化预期低。例:query“笔记本散热器”和商品“笔记本电脑支架”。
- 0分(不相关):语义上无关,用户点进来纯属误触。例:query“笔记本散热器”和商品“笔记本贴膜”。
分级不宜过多,标注人员在三档之间做判断,一致性才能保证。实践中如果标注人员对某条数据在1分和2分之间摇摆,我会建议一律归为0分或降为1分——宁可让模型保守一点,也不要让模型学会“什么都沾点边”的错误判断。
多语义标签这块,投放团队特别容易忽略。同一个query在不同场景下意图完全不同,比如“苹果”可能是水果、数码品牌、也可能是电视剧名。如果只给一条query打一个相关性标签,模型学到的就是“平均语义”,表现就是什么都匹配但什么都不精准。更合理的做法是给query打多个业务维度标签,包括:
- 品类意图:美妆、3C、食品、服饰
- 场景意图:送礼、自用、办公、旅行
- 人群意图:男性、女性、儿童、中性
- 价格带意图:低价、中端、高端
标注数据集中每一条query可以对应多个标签,商品/落地页也打同样的标签体系。模型在训练时不仅能学会“苹果和iPhone相似”,还能学会“苹果在数码品类下和iPhone相似,在食品品类下和红富士相似”。这个“带条件的相关性”才是投放场景里真正有价值的语义理解。
否定样本(Negative Samples)的设计就更讲究了。很多团队的标注数据集只有正样本,这是模型效果上不去的核心原因。对比学习的训练逻辑是“拉近正样本、推远负样本”,没有负样本,模型只知道什么相近,不知道什么不相近,向量空间里所有东西都会挤在一起。负样本的选取比正样本更考验业务理解,要选那些“字面上沾边、业务上不相关”的困难负样本。举几个我们在美妆业务里的例子:
| query | 困难负样本(不相关但字面像) | 说明 |
|---|---|---|
| 口红 | 口红收纳盒 | 品类同词,需求完全无关 |
| 敏感肌水乳 | 敏感话题的漫画书 | 有“敏感”字样,但明显不相关 |
| 男士洗面奶 | 女士洗面奶 | 人群标签冲突,投放中必须区隔 |
2.3 标注工具和人员配置:小团队如何低成本启动
标注工具没必要一开始就上复杂平台。我们团队早期就三个人,用的是一张在线表格加一个简单的打分页面。Excel表格分四列:query、商品标题、相关性得分、备注。后面数据量上了5000条以后,换成了开源标注工具Label Studio,花了半天时间部署,标注界面可以自定义字段,比表格效率高一倍。如果团队里没有能部署label studio的研发资源,用问卷星或者腾讯文档的收集表也能撑过启动期。
人员配置上,我强烈建议标注人员中包含至少一名一线的投放优化师。道理很简单:投放优化师最清楚什么词该匹配什么品,什么词是纯浪费钱。当时我们让两位优化师轮流标注,每天抽半小时标50条,连续标了两周,完成了核心的7000条种子数据。剩下的批量数据用半自动方式——先用规则和已有模型预标注,再由人工抽检校正。抽检比例建议不低于20%,如果抽检的一致率低于85%,就需要重新培训标注人员。
这里有一个特别重要的细节:标注数据要有“唯一真值”。对于分歧大的样本,不要用投票解决,要由业务负责人拍板。因为投放场景的“相关性”本质上是业务策略问题,比如“男朋友生日礼物”该不该匹配“卫衣”,取决于你的商品矩阵和转化目标,不是标注人员能凭直觉判断的。
2.4 数据集规模与质量检验:5000条还是50000条?
聊到数据集规模,先给个参考范围:起步阶段5000~10000条有效标注数据就够了,其中包含正样本、负样本和困难负样本三类。这里说的“有效”是指经过质检、标签一致的数据,不是原始标注量。50000条以上效果当然更好,但边际收益会递减,特别是当你的业务词表没有大规模更新时。
怎么检验数据集质量够不够?我提供一个不需要等模型训练完就能做的快速方法:随机抽取200条query,对每条query从你自己的标注数据里找出“业务上真正相关”的商品标题,用你当前使用的通用嵌入模型计算它们的余弦相似度,然后看相似度排名的分布。如果大量真正相关的样本排在40%以外,说明模型和业务语义偏差很大,需要训练的迫切性很高。如果一部分相关样本已经排在前10%,说明通用模型底子不错,数据集用来做微调就能见效。
另外一个实践技巧是用“同query多商品”的结构化检验。投放场景里,一个query往往有多个能成交的商品(比如query“白T恤女”可能对应纯棉款、修身款、长袖款),这些商品彼此之间也应该保持较高的向量相似度。如果标注数据集中这类同query多商品样本的向量距离远大于随机商品对,说明标注数据的内部一致性有问题,优先排查标注规范执行是否走样。
3. 嵌入服务从训练到上线的关键细节
3.1 模型选型对比:开源微调还是API调用
标注数据集准备到位后,接下来的问题是怎么用这份数据得到业务贴合度更高的嵌入服务。市面上可选方案大致三类,我按投放团队的典型资源状况做了对比:
| 方案 | 成本 | 定制程度 | 数据私密性 | 推荐场景 |
|---|---|---|---|---|
| OpenAI等闭源API | 按token计费,中高 | 低,只能做少量示例调优 | 数据需要出网,敏感业务慎用 | 快速验证、冷启动 |
| 开源模型API化(BGE、m3e等) | 部署后边际成本低 | 中,可LoRA微调 | 数据不出内网 | 大部分投放团队主选 |
| 自有模型重训 | 算力要求高,周期长 | 高,可完全自定义 | 数据完全私有 | 数据规模大、业务词表独特 |
投放团队如果第一次做,我的建议是直接从开源模型开始。BGE系列(BAAI/bge-large-zh-v1.5)和m3e系列在中文语义任务上表现比较稳定,参数量适中,单卡就能完成微调。不一定非得追求最贵的方案,先把流程跑通、看到业务效果提升,再决策要不要加大投入。
需要特别注意一个坑:嵌入模型和对话模型是两回事。很多人以为把对话大模型接进来就能做语义匹配,实际上对话模型做的是生成,嵌入模型做的是表征,两者的训练目标和推理方式完全不同。投放场景做语义检索匹配,选嵌入模型,不要被“大模型”三个字带偏。
3.2 微调策略实操:从对比学习到LoRA的落地配置
有了数据集和基础模型,训练环节可以走两条路径:一条是直接微调(Fine-tuning),适合预算充足、数据量大的团队;另一条是LoRA(Low-Rank Adaptation),只训练一小部分参数,微调成本低很多。我建议大多数投放团队用LoRA,原因是它的训练时间短(单卡几小时到一天)、显存占用低,且效果在标注数据量1万条以下时和全量微调几乎没有差别。
训练数据格式上,嵌入模型微调推荐用三元组格式:(anchor, positive, negative)。其中anchor是用户query,positive是强相关商品标题或落地页标题,negative是困难负样本。如果你的标注数据集中一条query对应多个positive和多个negative,可以随机组合成多个三元组,相当于数据增强。我们当时1.2万条标注数据,通过这种排列组合方式扩展到了4.2万条训练三元组,模型效果提升非常明显。
关键参数方面,LoRA的rank值设置在8到16之间比较稳妥。学习率要保守,建议5e-5到2e-4之间,太大了模型容易灾难性遗忘(catastrophic forgetting)——即模型记住了业务相关性,却丢失了通用的语言理解能力。batch size根据显存来,BERT系列模型batch size设32到64都行,对比学习任务对batch size比较敏感,越大效果越稳定。训练轮数不要贪多,2到3个epoch就能看到显著的loss下降,超过5个epoch小心过拟合。训练完成后需要跑一次验证集评估,看Recall@10有没有明显提升——经验值是从通用模型的0.6以下提升到0.8以上,才算真正达到了可上线水平。
3.3 部署与服务化:向量库选型和检索性能权衡
微调完成后,嵌入模型要变成一个真正能被投放系统调用的服务。整个部署链路包括三块:模型推理服务(把文本变成向量)、向量数据库(存储和检索向量)、检索服务(负责任务编排和API输出)。
模型推理服务最简单的方式是用FastAPI包一层,输入文本输出向量,单机部署就够。向量数据库的选型是这里的重头戏。如果向量量级在百万以下,用开源的FAISS(Facebook AI Similarity Search)就完全够用,它的内存索引检索速度极快,而且不需要独立的数据库服务。如果向量量级到了千万级别、需要持久化和高并发,就要上Milvus或Qdrant。我们团队当时商品标题加落地页素材总共80万条向量,用FAISS的IndexFlatIP(内积索引,配合归一化向量就是余弦相似度)可以做到10毫秒内返回top50结果,远远够用。
还有一个很多教程不会提的小细节:query向量和商品向量的生成不一定非要用同一个模型。我们实际线上跑了双塔结构,query侧用微调后的模型,但商品侧其实不需要每次都实时推理——商品标题和落地页是相对静态的数据,可以每天离线跑一次全量向量化存入向量库,只有增量商品才实时推理。这样既能把高成本推理放到离线,又能保证线上查询的实时性。如果商品信息变更频繁导致向量过期,可以设定每6小时或每天凌晨做一次全量刷新,具体频率按业务更新速度定。
3.4 评估指标体系:除了Recall还要看什么
嵌入服务的评估不能只看技术指标,更要看对投放业务的实际影响。我建议投放团队在灰度阶段就建立一套三层评估体系:
第一层是模型层指标。离线评测用Recall@k、MRR(Mean Reciprocal Rank)、NDCG@k。重点看Recall@10,也就是“真实关联的商品有没有出现在模型返回的前10个结果里”。
第二层是检索层指标。检索结果线上AB测试时,统计“首条结果的点击率”和“前三条结果的点击率”。这两个指标能直观反映语义检索结果的相关性排序是否合理。
第三层是业务层指标。这是最终要考核的——竞价关键词的转化率有没有提升、搜索投放的ROI是否上涨、无效点击率是否下降。我当时跑了一组对照实验,启用嵌入服务后,搜索广告“搜索词-关键词-商品”三个层级的匹配准确率提升了27%,点击率提升了8%,转化成本下降了12%。数据虽然因行业而异,但方向是明确的:语义匹配改善带来的,不只是流量数量的增加,更重要的是流量质量的提升。
4. AI搜索优化:从向量检索到转化提升的完整链路
4.1 搜索入口的改造:关键词匹配、向量召回、混合检索的顺序问题
嵌入服务跑通之后,就到了整个项目的核心收益环节——AI搜索优化。这一步的目的是把前面做的所有语义能力注入到真实的搜索链路里,让用户搜得更准、转化率更高。
改造之前要先理解:纯向量检索有一个明显的短板——它对精确词条不敏感。用户搜“iPhone 15”,向量检索可能返回一堆“手机壳”“充电器”等周边商品,因为这些商品的文本和“iPhone 15”在向量空间里距离也不远。这在线下测试时看起来很合理,但真实投放场景里,搜“iPhone 15”的用户就是想买手机本体,你给他推荐手机壳无异于把流量导给了错误的方向。
解决方案是混合检索(Hybrid Search):同一路query同时走传统的关键词匹配和向量语义召回,然后把两路结果做融合排序。具体做法是关键词匹配保证精确词不丢,向量召回负责兜住同义改写和口语化表达,两部分结果按加权分数合并。我们线上的初步权重设置为:关键词命中结果权重0.6、向量召回结果权重0.4,后续根据AB测试的转化数据再微调比例。有一个比较常见的调参规律是:如果业务词表很全、商品标题很规范,关键词权重可以高一些;如果用户query口语化严重、SKU名称又和用户表达差异很大,向量权重就要往上提。这需要在灰度测试里反复试,没有一个固定答案能适用于所有业务。
4.2 召回阶段的提效手段:query改写、词权重和意图识别
混合检索的底层框架搭好以后,提升召回效率的关键手段有三个,都依赖前面做的嵌入服务和语义能力。
第一个手段是query改写(Query Rewriting)。用户搜索时经常出现错别字、拼音、口语缩写,比如“js”可能是“健身器材”或“计算器”。通过嵌入模型把query和业务标准词表做语义匹配,把“js”映射到概率最高的标准词,再进入检索链路。这个映射过程本质上是把向量相似度最高的标品词作为改写候选,再结合历史点击数据做一次校验。错别字场景下,这里的召回提升效果非常直观。
第二个手段是词权重分配。有些词是核心意图词,比如“降噪耳机”里的“降噪”,有些词是修饰性词,比如“高性价比”。用嵌入模型对query做分词后的短语向量分析,给每个词分配不同权重,再进入检索。这样做的好处是,用户搜“便宜好用的降噪耳机”时,检索系统会优先匹配“降噪耳机”相关商品,而不是被“便宜好用”带偏到一堆完全不同品类的低价商品。
第三个手段是意图识别(Intent Detection),本质是对query的多标签分类。用之前标注数据里带的多语义标签训练一个轻量分类器,将query归类到品类意图、场景意图、价格带意图等维度。意图识别结果不直接决定召回什么,而是决定召回后的排序权重——比如识别出“送礼”意图后,包装精美、品牌溢价高的商品排序权重就上调;识别出“低价”意图后,价格带吻合的商品优先展示。
4.3 排序融合策略:把向量相似度、业务权重和转化信号做成综合分
排序是AI搜索优化里最能拉开差距的环节,也是投放团队最容易掉以轻心的部分。很多团队以为向量相似度高就等于用户想买,其实不是。用户搜“白T恤女”时,向量相似度最高的可能就是销量最高的十件白T恤,但投放的目标不是展示最“像”的商品,而是展示最有可能成交的商品。所以排序分数不能只由向量相似度决定,必须融入业务信号。
我采用的综合排序公式大致是这样:
final_score = α×语义相似度 + β×业务权重 + γ×转化信号
- 语义相似度:直接取嵌入模型算出的余弦相似度,归一化到0~1区间。
- 业务权重:包含毛利区间、库存深度、测款阶段的新品加权、活动期间的定向加权。比如清仓品在这个阶段就要加权,不然积压库存会拖累整体ROI。
- 转化信号:来自历史数据的CTR(点击率)和CVR(转化率)统计。冷启动商品没有历史数据时,用同类商品的均值兜底。
三个模块的权重需要灰度测试。以我的经验,商业业务里γ转化信号的权重通常会越调越高,因为历史转化数据比任何语义模型都更贴近用户真实意图。上线初期α和γ可以各占40%,β占20%,跑两周看数据再调。如果你发现某个中间页或某个品类的转化率异常高,也可以按品类单独设置权重策略,而不必全局统一。
4.4 搜索结果展示优化:标题高亮、关联推荐与落地页承接
AI搜索优化做到排序这步还不够,用户看到搜索结果的瞬间,页面上呈现的信息直接决定了点击率。嵌入服务的语义能力在这里依然能发挥作用——它能把query的核心意图映射到展示要素上。
一个很有效的优化手段是搜索词高亮。传统高亮算法只对字面匹配的词做加粗,语义匹配的query(比如“烂番茄色”匹配到的“枫叶红”口红)没法高亮。通过嵌入服务将query映射到商品标题的标准词位之后,可以在匹配段前后加入样式标记。用户看到一行“枫叶红”口红标题里“枫叶红”三个字被高亮,会立刻觉得“这就是我想要的”,点击率自然上升。这种体验改造虽然不起眼,但带来的点击率提升往往能直接反映在广告质量分上。
关联推荐也是值得一做的地方。嵌入模型算出了所有商品在向量空间里的距离,那“看了又看”“买了又买”栏目可以直接用向量相似度做候选召回,再加上同品类和互补品规则做过滤。这套逻辑比“基于用户行为协同过滤”更适合冷启动场景,因为新商品没有用户行为,但它的标题向量依然能和已有query的商品向量做关联。这里对转化率的贡献,更多是客单价层面——给用户提供更多他可以买的东西。
落地页承接方面,核心是把query的意图信息传递到落地页脚本里。搜索广告点击进入落地页时,落地页可以根据query的意图分类动态调整首屏内容结构:识别出“送礼”意图,首屏就突出礼品包装和品牌故事;识别出“低价”意图,首屏先展示价格区间和优惠券信息。页面与意图的一致性越好,跳出率越低,转化率越有保障。这种页面优化看似和技术无关,但其实是AI搜索优化闭环里直接体现在转化报告上的部分。
5. 完整数据回流:让AI搜索的效果越跑越好
5.1 用户行为数据如何变成下一轮标注数据
AI搜索优化不是一个一次性的改造项目,它更像一个持续迭代的数据飞轮。搜索系统上线后每天会产生新的用户行为数据,这些数据如果只是躺在日志里就浪费了。我建议把行为数据按规则自动回流,形成下一轮的标注数据集。
具体的回流规则包括几类:
- 高转化样本(query+成交商品)直接作为新的强正样本
- 高点击但低转化的样本,打上“误吸引”标签,作为高质量负样本的补充
- 无结果的query,进入一个专门的“词汇缺口”池子,由投放团队定频审核,补充进标准词表或业务知识库
- 转化归因后确认是竞品词或无关词的用户搜索,进入否定关键词候选池
这套回流机制不需要每天跑,每周跑一次数据ETL(提取-转换-加载)就能保持数据新鲜度。关键是回流的数据要经过和最初标注一样的质检流程,不能无条件自动入池,否则数据质量会被劣质行为污染。我见过有些团队把“曝光但未点击”全部当成负样本灌进数据集,结果模型学到“所有曝光过的商品都不相关”,把原本相关的也推远了,效果反而下降。
5.2 投放词表的自助扩展:从人工挖词到语义拓词
投放团队的日常工作中,关键词拓展是最耗时耗力的任务之一。有了嵌入服务后,这件事可以变成半自动流程。具体做法是:将当前的主力成交词作为种子词,通过嵌入模型计算种子词与业务词表全集(或竞品词表)的向量相似度,按相似度从高到低排序,取出Top50候选词。再由投放优化师人工筛选,将符合条件的词加入投放词库。
这套流程跑起来后,最大的变化是拓词效率的跃升。种子词50个,每个取Top50,实际去重后大约能拿到1500到2000个候选词。人工筛选1500个词大约需要两小时,但过去人工从零挖掘这1500个词至少得干一周。考虑到投放词的数量直接影响流量池的规模,这一步带来的量级提升是非常可观的。
需要提醒的是,拓词后的审核环节不能省。向量相似度只能保证语义相关,不能保证每个词都有商业价值。要有一个人为判断的关卡,把没有购买意图的词(比如纯资讯类query)、已经失效的商品相关词(比如停产型号)过滤掉。这个关卡由谁来做?还是那句话,一线的投放优化师最合适。
5.3 与广告平台算法的协同:质量分、相关性反馈和出价联动
IAI搜索优化做得好不好,最终要看广告平台的反馈。搜索广告平台在评估广告质量时,有一条重要指标是“关键词-广告标题-落地页”三者的相关性。AI嵌入服务恰好能让这三者达成语义层面的一致性:关键词从语义层面匹配用户搜索,广告标题由系统自动生成或挑选与query最相关的文案,落地页则根据query意图动态调整页面内容。三者都围绕同一个用户意图组织,平台的质量分自然会提升,进而带来更低的点击成本和更高的广告排名。
举个例子说明这种协同关系。用户搜索“会议室用的无线麦克风”,传统投放下关键词可能是“无线麦克风”,广告标题是“专业无线麦克风推荐”,落地页是麦克风列表页。三者字面都相关,但细看会发现“会议室用”这个场景需求没被承接。而AI搜索优化后,系统识别出场景意图,匹配的关键词可能扩展为“会议室无线麦克风”,广告标题动态生成“会议室无线麦克风-清晰收音-即插即用”,落地页首屏展示会议室适用型号。平台看到的是三者的深度相关性提升,用户看到的是更精准的广告,结果是CTR和CVR双升,质量分上涨,投放成本下降。
不过这里有一个跟平台算法的细节要特别拎出来讲:账户级别的数据积累是长期的,不要因为嵌入服务短期没改变出价结果就轻易回滚。语义匹配对广告质量分的影响在长周期里才会逐步显现出来。我们上线后的头三天,账户各项指标几乎没变化,当时团队里还有人质疑这套东西到底有没有用。到第二周数据才发生明显拐点,点击率、转化率、质量分开始持续攀升。所以灰度测试周期一定要设够,至少留出2到4周完整观察期,不要被前几天的“无变化”干扰判断。
5.4 敏感词过滤与投放安全:语义匹配带来的合规新要求
做投放的团队都清楚,广告平台对违禁词、敏感词的审核是红线。这里提醒一个语义匹配带来的新课题:传统违规词过滤是基于词表匹配的,词表更新慢,容易被变体绕过去。而嵌入服务的语义泛化能力,如果不加控制,可能在“灰色地带”的query上产生不可控的匹配结果。
实操上需要给嵌入服务加一道“安全护栏”。我们的做法是维护一份“业务安全词表”,包含高危词、边界词和合规性存疑的表达。所有进入检索系统的query先过安全词表匹配,命中的query直接降权或拦截,不进入语义召回流程。这个安全词表需要定期更新——每周复盘一次搜索词报告,把新出现的高风险变体补充进去。语义匹配的泛化能力是一把双刃剑,用在正向拓词上是效率利器,用在边界query上就可能带来内容安全风险,这个度要靠规则去兜住。
5.5 搜索引擎友好化:嵌入服务对自然流量的间接促进
AI搜索优化不只是影响广告流量的转化,对自然搜索流量同样有带动作用。很多投放团队只盯付费流量,忽略了一个事实:自然搜索流量进入落地页后,如果停留时长、浏览深度、跳出率这些行为指标表现好,对整站的搜索权重评估有正向意义。
用嵌入服务优化站内搜索和推荐后,用户找东西的路径变短了,从进入到成交的时间缩短,复访率也可能提升。这些行为信号虽然不容易直接归因于某次改动,但在SEO与SEM协同的视角下,是值得重视的长期收益。一个站内搜索体验糟糕的页面,无论砸多少钱投广告,也难以支撑起高转化率。而当站内搜索体验优化后,广告带来的流量转化率提升,自然搜索的排名与流量也会跟着水涨船高,两者相互放大,形成正向循环。
6. 实测效果复盘:一组对照组数据和三个典型坑
6.1 对照组实验设计与数据表现
任何一个投放优化项目,最怕的就是“凭感觉说有效”。嵌入服务和AI搜索优化上线时,我用两周时间跑了一组严格的对照组实验。实验组和对照组划分到同一产品线,预算一致,唯一变量是是否启用嵌入服务语义匹配与AI搜索排序。
两周实验结束后,核心数据对比如下:
| 指标 | 对照组(传统关键词匹配) | 实验组(嵌入服务+AI搜索优化) | 变化幅度 |
|---|---|---|---|
| 搜索词点击率 | 2.1% | 2.9% | +38% |
| 转化率 | 1.8% | 2.3% | +28% |
| 转化成本 | 平均48元/单 | 平均40元/单 | -17% |
| 无效点击率 | 22% | 13% | -9个百分点 |
这次实验给了我三点确认:一是语义匹配确实能提升“搜索词-商品”的相关性,直接反映在点击率和转化率上;二是转化成本的下降比点击率提升更明显,说明流量质量在变好,而不是单纯变多;三是无效点击率的下降对广告预算的节约非常可观,按当时的广告量级折算,每月能省出一名优化师的工资。
6.2 数据标注阶段踩过的三个坑
整个项目做下来,踩过的坑不少,这里挑三个对结果影响最大的展开说说。
第一个坑是早期负样本太“简单”。第一批标注数据里,我们选的负样本都是和query完全无关的(比如“连衣裙”对“机械键盘”)。这类负样本模型很容易区分,训练完测试指标好看,但上线后效果没什么变化。后来才意识到,需要的是困难负样本——那些和query字面相关、但业务意图无关的样本,比如“口红”和“口红收纳盒”的搭配,模型才有足够的判别力去学习业务层面的差异。这次调整之后,真实搜索场景的无效点击率才出现了实质性下降。
第二个坑是标注数据不干净。我们曾经把一批从客服对话里提取的query直接灌入数据集,没做去重和清洗。结果里面大量重复表达(比如“你家那个蓝裤子”出现几十次),模型训练时被重复样本带偏,对这类口语表达的区分能力反而下降。后来对所有query做了归一化处理:统一大小写、去除符号、同类口语表达合并计数,数据干净了以后效果才稳定。
第三个坑是评估周期太短。第一次试验只观察了五天,发现转化率没有显著变化就想回滚。还好当时拦住了,等到第二周,数据才出现明显拐点。嵌入服务的语义匹配是作用于整条搜索链路的,从query分析到召回排序再到落地页展示,每个环节都需要数据积累,最终反馈到转化端需要时间。投放团队的耐心阈值,至少要给到两周以上。
6.3 数据闭环跑通之后的扩展方向
把AI嵌入服务和AI搜索优化的链路跑通之后,这套能力可以继续向外扩展,应用面比搜索大得多。我自己的经验是,至少有三个方向值得尝试。
一个是素材标题的批量生成。利用嵌入模型对历史高转化素材的标题做语义聚类,提取出高转化主题和卖点角度,再配合AIGC工具生成新标题,由投放团队从语义向量距离上过滤掉和已有素材重合度太高或太低的部分。这个思路能稳定提升素材生产的初始质量。
一个是用户画像与商品标签的对齐。嵌入模型把用户历史行为、偏好描述和商品特征做语义映射,就能实现用户和商品的“匹配度打分”,这在信息流投放的定向策略里也可以当作一个特征去使用。
还有一个是智能竞价关键词分类。对关键词按语义向量聚类,自动发现哪些词处于同一个竞争品类里,辅助做预算分配和出价分层。比如同一品类下高转化词、防御词、种草词,预算配比可以基于向量聚类的分组来精细调整,比人工经验分词的效率高出不少。
这些扩展方向本质上都是在复用同一套资产:标注数据集+嵌入服务+语义检索能力。前期投入一次,后续多个业务场景同时受益,这也是我为什么一再强调“数据集先行”——因为后面的每一项扩展,都依赖这套数据基础。
7. 最后一次涂装的注意事项
到了项目收尾阶段,还有几个容易被忽视的细节想多说一嘴。这些事不直接影响模型训练,但直接影响项目能不能在团队里长期跑下去。
第一,知识和数据资产的沉淀。标注数据集不是一次性项目,它会随业务变化持续迭代,所以文档、标注规范、数据集版本管理必须有条理。我建议至少维护三份文档:标注规范(给标注人员看的操作手册)、数据版本日志(记录每次数据更迭的内容和原因)、模型评估报告(每次训练后留档)。否则半年以后,你已经不记得当前线上模型是用哪批数据训练出来的,迭代效果也无法精确归因。
第二,跨团队协作的节奏。投放团队、数据团队和研发团队的节奏常常不一致,项目可能卡在“数据标注等着投放提需求,投放等着研发搭工具”的循环里。我踩过这个坑之后的经验是:由投放侧推数据目录,明确告诉数据团队“我有哪些数据源、想要什么样的标注结果”;由研发侧盯工程链路,保证从标注到训练的流水线顺畅。每周固定一次短会同步进展,保持节奏对齐,比一次性开完需求会强得多。
第三,关注新工具和新模型。嵌入模型领域的迭代速度很快,公开评测集上新模型层出不穷。但我的经验是:不要追新,要追贴合业务的验证。每次看到新模型时,拿出来跑一遍自己的标注数据集,用标准评估脚本对比当前线上模型。如果新模型在业务数据集上Recall@10显著领先,再考虑切换;如果差别不大,就留在当前版本不动。这样既不会错过技术红利,也不会因为频繁换模型导致效果波动。
如果你所在的投放团队正面临搜索词和商品匹配不准、长尾词拓展困难、无效点击偏高这几个问题,我建议按照本文的路径走一遍:先从历史搜索日志和客服数据中自动造一批种子标注,再把标注规范定清楚,找一线的投放优化师参与标注与质检。数据量到5000条以上就可以开始微调嵌入模型。然后接入混合检索,把向量召回与传统关键词匹配结合,再把业务权重和转化信号融入排序公式。最后务必跑够两周的灰度测试,用数据说话,持续推进数据回流和模型迭代。这套链路不能说简单,但它带来的流量质量提升与转化成本下降,是传统关键词匹配模式很难达到的。