告别冷启动难题:JEV-27B-VL零样本短视频推荐,仅凭封面追平5.9万用户协同过滤(AUC 0.727)
【免费下载链接】JEV-27B-VL项目地址: https://ai.gitcode.com/hf_mirrors/autotrust/JEV-27B-VL
JEV-27B-VL 是一款会“看图决策”的多模态大模型。它的System 1决策头只需要看一眼封面,就能在单次前向推理中输出“该用户会不会看这条视频”的校准概率——零样本短视频推荐,不需要任何交互日志,AUC 达到 0.727,追平了用 5.9 万条用户观看记录训练出来的协同过滤模型。对短视频平台、内容社区来说,这意味着新视频上传的第一秒就能被排序,冷启动问题从此不再无解。
📺 什么是冷启动?短视频推荐的第一道坎
短视频信息流每天都要回答一个高频问题:这条新视频,该不该推给这个用户?
传统协同过滤(CF)的回答是:“我先看看别人点了什么”。但新视频没人点过,新用户没有历史记录——协同过滤在“零行为数据”面前直接失灵,这就是推荐系统著名的冷启动问题。
JEV-27B-VL 的思路完全不同:不看行为,看封面。它读取用户最近看过的 5 个视频的封面 + 1 张候选视频封面,直接输出概率值,视频有没有人看过、账号是新是旧,都不影响决策。
🧠 一个模型,两种“思考方式”
JEV-27B-VL 基于 Qwen3.8-27B 构建,内部包含两个系统:
| 系统 | 做什么 | 输出 | 典型耗时 |
|---|---|---|---|
| System 1 | 对文本和图片做一次性判断 | 每个选项的校准概率(是/否、多选一、0–5 打分) | 约 0.1 s |
| System 2 | 完整的 27B 模型逐步推理 | 文本 / 推理链 | 数秒 |
短视频推荐走的就是 System 1:发一个 yes/no 问题,拿回形如{"true": 0.83, "false": 0.17}的概率,无需解析、无需提示词技巧。它的视觉决策头在训练时从未见过图片,纯靠零样本迁移就做出了接近专用推荐模型的效果——模型结构可参考 config.json,校准参数见 calibration.json。
📊 实验结果:0 行为数据 vs 5.9 万用户日志
评测基于公开数据集 MicroLens-100k(真实短视频平台数据,含原始封面图)。对 200 名用户,把用户实际下一个观看的视频藏进 19 个同时期其他用户在看的视频里(即信息流当时会展示的内容),所有方法对 20 个候选统一排序:
| 方法 | 是否用交互日志 | AUC | HR@5 | NDCG@10 |
|---|---|---|---|---|
| 随机排序 | 否 | 0.489 | 0.205 | 0.219 |
| 标题相似度(TF-IDF) | 否 | 0.602 | 0.385 | 0.367 |
| JEV-27B-VL System 1(仅标题) | 否,零样本 | 0.649 | 0.455 | 0.399 |
| JEV-27B-VL System 1(仅封面) | 否,零样本 | 0.727 | 0.590 | 0.498 |
| 基于物品的协同过滤 | 是,59,045 名用户 | 0.728 | 0.490 | 0.503 |
三个结论值得记住:
- 零行为数据追平协同过滤:AUC 与由 59,045 名用户观看历史训练出的 CF 相同(差异 0.000,95% 置信区间 −0.041 ~ +0.040),Top-5 命中率反而更高(59% vs 49%)。
- 彻底解决冷启动:CF 必须有共看历史,JEV 只需要封面图——新视频、新创作者从第一秒起就能被推荐。
- 看图比读文字强:仅用封面的 AUC 比仅用标题高 +0.078(95% 置信区间 +0.031 ~ +0.126),封面承载的品味信号比标题更多。
一个典型例子:某用户此前在看漫画解说与配音剪辑(含某系列 1.6 集)。JEV-27B-VL 仅凭封面就认出同一系列,把 1.9 集排在 20 个候选的第一位(点击概率 1.00)——而那正是用户下一个观看的视频,20 张封面共耗时约 2.6 秒。
🚀 快速体验:一条命令启动服务
模型以 Apache-2.0 开源,部署只需两行命令(需一张 80GB 以上的显存):
hf download autotrust/JEV-27B-VL --local-dir JEV-27B-VL bash JEV-27B-VL/serve.shserve.sh会启动 vLLM 服务,并挂载 System 1 专用的POST /v1/decide路由(实现见 serve_decide.py):发送kind / state / question / options,即可拿到每个选项的校准概率,state支持文本和图片混合输入。LoRA 决策头配置在 adapter_vllm/ 目录下。
📰 不止短视频:零样本能力的更多证据
封面推荐不是孤例。在同一套“只看内容、不训练”的设定下:
- 新闻推荐(MIND 数据集):零样本 AUC0.642,超过所有零样本基线(最佳 0.606),也超过在数据上训练过的 LightGBM 排序器(0.590 / 0.616);
- 搜索重排(TREC-COVID):nDCG@10 0.858,超过专用重排模型 bge-reranker-v2-m3(0.793);
- 多模态评判(VL-RewardBench):78.3% 准确率,位列官方排行榜第一。
⚠️ 客观局限:这些边界要知道
- 该推荐结果来自单个数据集、200 名用户的离线评测,生产环境表现需自行验证;
- System 1 的决策头在文本上训练,图片任务是零样本,图片任务上的概率校准尚未系统测量;
- 服务时需保持
--max-num-seqs 8,否则该多模态模型的 LoRA 路径可能返回错误概率。
总结
JEV-27B-VL 用“看封面”代替“看日志”,把短视频推荐中最棘手的冷启动问题转化为一次普通的图像理解——AUC 0.727,与 5.9 万用户规模的协同过滤打平,Top-5 命中率反超 10 个百分点,且新内容上传即可排序。对刚起步的内容团队而言,这可能是当前最容易落地的零样本推荐方案。更多实验细节与基准数据见 README.md。
【免费下载链接】JEV-27B-VL项目地址: https://ai.gitcode.com/hf_mirrors/autotrust/JEV-27B-VL
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考