最近打开 WorkBuddy 翻了一眼模型列表,发现多了个入口:Hy4 preview。再习惯性看一眼公告栏,这次确实有点意外——双模型限免直接安排上了,Hy4 preview 开放限免体验两周,Hy3 的免费窗口更是直接拉到了 9 月底。这种“新老模型一起放开”的操作,对 WorkBuddy 用户来说是一个值得抓住的时间窗口。
我自己的 WorkBuddy 工作台已经跑了一段时间了,从最初只是拿它当“高级问答框”,到后来接连接器、配 Skill、写自定义指令,慢慢把它变成了一个每天都在用的效率中枢。这次 Hy4 preview 和 Hy3 同时限免,我刚好利用这个机会在两个模型之间反复切换做对比测试,也顺手把限免期常见的问题摸了一遍底。这篇就把我的实测体会、选型思路和配置经验整理出来,给准备上车或者还在观望的同学做个参考。
1. 先搞清楚 WorkBuddy 解决的是什么问题
1.1 它不是又一个聊天机器人
很多人第一次接触 WorkBuddy 时,第一反应是“这不就是个 AI 对话工具吗”。站在聊天这个功能上看,这个理解不算错,但远远不够。WorkBuddy 真正的定位是效率智能体、个人工作台,核心不是陪聊,而是把一整套工作流程里需要人工反复操作的环节,拆成可由 AI 驱动、可配置、可自动执行的任务流。
打个比方,普通 AI 对话好比是你请了一个顾问,你问一句他答一句;WorkBuddy 是把这个顾问放进了你的办公室里,让他能看你的日程、读你的文档、帮你整理表格、定期跑一遍检查清单,甚至通过连接器去更新某个业务系统里的数据。顾问还是那个顾问,但“能干活”和“能聊”是两个完全不同的层次。
另外,WorkBuddy 的部署方式也和单纯在线聊天工具不一样。它支持本地部署,也就是说你的对话记录、知识库、自定义指令这些相对敏感的东西,可以跑在自己的环境里。对有数据合规要求的团队来说,这个能力往往是决定用不用的第一优先级。
1.2 Skill、连接器、自定义指令,三个概念先理清
要在 WorkBuddy 里把双模型限免用出价值,首先得理解它的三个核心概念。
Skill(技能):可以理解为给 AI 预置的一套专业知识加操作流程。比如你装了一个“周报生成”Skill,那 AI 在帮你写周报时就知道该调用哪些数据、按什么结构组织、用什么样的语气输出。没有 Skill,AI 是全科但平庸的实习生;配了 Skill,它就成了熟悉你们部门规则的熟练工。
连接器(Connector):负责让 WorkBuddy 和外部系统通信。钉钉多维表、Obsidian、企业微信、各类数据看板,都是通过连接器接进来的。连接器解决的是“AI 能知道什么”的问题——它不只是靠预训练知识回答你,而是能去真实的工作系统里读取最新数据,再基于这些数据做分析或生成内容。
自定义指令(Custom Instructions):这是你直接告诉 AI 的做事规矩。比如“所有回复控制在300字以内”“先给结论再给过程”“涉及金额时标注风险项”。一套好的自定义指令,比盲目换大模型提升效果来得更快。
这三个东西的关系可以这么理解:连接器负责延长 AI 的手,Skill 负责武装 AI 的大脑,自定义指令则是在给 AI 立规矩。三者配合好了,再叠加上合适的模型,整个工作台的效率才会真正起来。我见过不少人拿到 WorkBuddy 之后直接开始聊天,连连接器都没配过,那其实只发挥了这个工具不到两成的能力。
2. 双模型限免到底送了什么
2.1 Hy4 preview:两周窗口,主要给尝鲜和验证用
Hy4 preview 的限免时间是两周。对于一款模型来说,预览版通常意味着它具备新一代架构的能力,但在稳定性、边界行为、兼容性上可能还没完全打磨到正式商用水平。选择在这个时间点开放限免,一方面是想让用户提前体验新能力并收集反馈,另一方面也是在真实场景里做压力测试。
两周时间看似不长,但对个人用户来说,足够做一次完整的评估了。我建议在这两周里不要只拿它闲聊,而是把你日常最高频的三到五类任务分别跑一遍。怎么跑?记录四个维度就行:输出质量、响应速度、指令遵循程度、出错率。我自己的方式是把这些记录丢在一个专门建的任务队列里,每做完一类就对比一下。两周下来,你就能判断正式版出来之后,Hy4 preview 值不值得作为主力付费使用。
另外提醒一句,预览版的限免通常和正式版的定价是两套逻辑。别因为限免期用起来爽,就默认以后都免费,那基本不可能。真正的价值在于趁免费先把效果测明白,等收费的时候你心里有数。
2.2 Hy3:免费到 9 月底,适合踏实当主力
Hy3 作为上一代模型,最大的优势是稳。它经历过完整的上线周期,各类边界情况都被磨过一遍,在常规任务上的表现有比较稳定的预期。这次直接把免费窗口拉到 9 月底,给了用户非常充裕的时间去把 WorkBuddy 的工作流搭起来,不用一边搭一边算调用成本。
对还在观望的新用户来说,Hy3 其实就是最好的入门模型。不确定什么任务该用什么模型的时候,选 Hy3 基本不会翻车。等把工作流跑顺了,再尝试把特定环节切到 Hy4 preview 上对比一下,这个策略最省钱也最省心。
我特别想强调的是,Hy3 在限免期内适合干一件事:把你的自动化流程全部建好。因为工作流这种东西需要反复调试,调一次跑一次都会消耗模型额度。如果在 Hy3 免费期把这些都调通了,等活动结束再评估要不要继续用,或者要不要升级到 Hy4 preview,决策成本会低很多。
2.3 怎么确认自己已经用上了限免额度
很多人在 WorkBuddy 里看到模型列表有 Hy4 preview 和 Hy3,但不确定自己到底有没有用上,或者担心超了会被收费。以我实测的经验,可以从三个地方确认。
第一是模型选择器。在对话或任务配置界面,看当前选中的模型名称是否显示为 Hy4 preview 或 Hy3。限免期内这两个选项前端一般会带“限免”“免费”之类的标识,没有标识的话建议去官方公告里确认一下活动规则。
第二是用量页面。在账户的用量或配额页面查一下调用记录,限免期内的调用通常会单独标记。如果显示的是限免额度,就不会计入付费账单。
第三是实测验证。切到 Hy4 preview 后,用一个平时回答起来比较套路的问题去测一下,感受响应风格的差异。再切回 Hy3 对比,如果输出风格和推理路径明显不同,说明切换生效了。
需要提醒的是,限免政策随时可能调整,建议在活动期间把关键任务都跑一遍,别把“限免”当成“永久免费”来依赖。
3. Hy4 preview 与 Hy3 的选型:别只盯着“新不新”
3.1 Hy4 preview 强在什么地方
从我这几天的对比测试来看,Hy4 preview 给我最明显的感受是:复杂指令的遵循能力更强。同样是让它“读一遍文档,提取其中的风险点,并按严重程度排序输出成表格”,Hy4 preview 在步骤拆分和格式执行上更不容易丢环节。Hy3 有时候会漏掉“按严重程度排序”这个要求,或者表格结构写得不够规整,需要你再回炉一次。
在多轮对话的长上下文处理上,Hy4 preview 的稳定性也更好。我测试过一次让它连续处理三份有部分重叠的会议纪要,要求做去重合并。Hy3 在第二轮开始会出现记忆偏差,把前面已经处理过的内容重复输出;Hy4 preview 在这方面的表现干净很多,基本能准确判断哪些信息已经在前面出现过、哪些是新内容。
不过预览版也有它的小脾气,偶尔会在某些边界问题上给出比较固执的回答。我的经验是:做创造性内容、复杂分析、长文档处理时优先用 Hy4 preview;做日常问答、模板化输出、需要一次就成的任务时,Hy3 反而更省心。新模型强在处理复杂任务,但在简单任务上并不一定比老模型有优势,有时候还会因为想得太多而导致输出啰嗦。
3.2 Hy3 的价值被很多人低估了
大家都在追新模型,但 Hy3 在限免期内其实是被低估的存在。那些你每天都要跑、跑了很多遍、几乎可以预判输出形态的任务,比如周报整理、待办提取、邮件草拟,交给 Hy3 完全够用,而且胜在稳定、不出幺蛾子。与其用新模型在这种重复任务上浪费宝贵的预览额度,不如把 Hy3 当成默认选项,把 Hy4 preview 留给真正需要高级推理的场景。
打个比方,Hy3 像是用了两年的老朋友,他的能力边界你摸得很清楚,重要事情交给他放心;Hy4 preview 像是刚来的新同事,脑子确实更快,但你还不完全清楚他在压力下会怎么反应。重要程度低、频率高的任务交给老朋友,重要程度高、难度大的任务让新同事上,这大概就是最合理的分工。
还有一个容易忽略的点:模型的稳定性直接影响到你工作流里下游任务的可靠性。如果你的自动化流程里,AI 的输出要作为下一步的输入,那“稳定可预期”比“偶尔惊艳”重要得多。一个格式忽好忽坏的模型,哪怕单次效果再好,也会给你的流程带来大量返工。从这个角度看,Hy3 在限免期内的价值被大多数人低估了。
3.3 我目前使用的分配策略
我现在的工作台里是这么分配的:
| 任务类型 | 首选模型 | 原因 |
|---|---|---|
| 日常问答、信息查询 | Hy3 | 响应快、稳定、成本可控 |
| 周报、日报整理 | Hy3 | 模板化输出,不需要过度推理 |
| 长文档摘要、知识库问答 | Hy4 preview | 长上下文处理能力更强 |
| 复杂数据分析、多条件任务 | Hy4 preview | 指令遵循和多步拆解更好 |
| 创意写作、方案框架构思 | Hy4 preview | 生成质量更高,套话更少 |
| 定时自动执行的任务 | Hy3 | 保证流程稳定优先 |
当然这只是一个参考,实际要怎么分得看你的业务类型。关键在于平时就养成按任务分模型的习惯,而不是打开工具随便选一个就开跑。任务类型不同的底层逻辑是:简单任务求稳定,复杂任务求能力,批量任务求成本。模型切换的成本几乎为零,多动一下手指省下的是后面反复调整的时间。
4. 把限免期变成生产力:实操配置指南
4.1 模型切换的几种方式
WorkBuddy 里切换模型有不同的入口,我常用的有三种。
第一种是全局默认模型。在设置里指定一个全局模型,所有新建的对话和任务只要不单独设置,就默认走这个模型。适合业务场景比较单一的用户,设置一次就不用管了。
第二种是单对话切换。在每个对话的模型选择器里单独切换,适合同一段时间内需要和不同模型并行协作的场景。比如我经常同时开两个对话,一个用 Hy3 整理待办,一个用 Hy4 preview 分析文档,互不干扰。
第三种是任务级指定。在配置自动化任务时,为每个任务单独指定模型。这是我最推荐的方式,因为任务一旦固定下来,模型选型也应该固定。不要指望一个模型能适配所有任务,把不同任务的模型选型固化到配置里,才是长期效率最大化的做法。
我的习惯是全局默认选 Hy3,然后把需要 Hy4 preview 能力的长文档处理、复杂分析类任务单独指定。这样既不会在简单任务上浪费新模型的额度,也能保证复杂任务优先享用更好用的模型。
4.2 用好 Skill 和自定义指令,模型才有用武之地
模型只是发动机,要让 WorkBuddy 跑起来,还得配好 Skill 和自定义指令。
以我自己搭的“客户反馈分析”工作流为例:连接器定时从反馈表里拉取新增数据,Skill 负责把反馈按产品线分类、提取高频问题、识别情绪倾向,最后再通过自定义指令要求输出时带上“问题等级标注”和“建议下一步动作”。这套流程跑通之后,每周能省下我差不多两三个小时的人工整理时间。没有 Skill 和连接器的话,这些数据你只能手动复制粘贴给 AI,哪还有什么效率可言。
自定义指令方面,我强烈建议花点时间打磨。一个基础的指令模板大致包含四块:角色定位(你是什么身份)、任务规则(输出格式、语气、长度限制)、边界约束(哪些内容不处理)、输出要求(先结论后细节、用表格等)。拿我常用的一条指令举例:
你是一名项目助理,负责整理团队例会纪要。规则:只提取与本周任务相关的信息,忽略寒暄和无关讨论;输出格式为 Markdown 表格,包含任务、负责人、截止日期、风险标注四列;如信息缺失,标注“待确认”而不是猜测;输出控制在200字以内。
指令写得越具体,模型输出的质量就越稳定。这一点在 Hy3 上体现得尤其明显——指令清晰的时候,Hy3 的表现完全不输给 Hy4 preview。反过来,如果你指令写得含糊,再强的模型也救不了。
4.3 本地部署和连接器需要注意的几个点
如果你打算把 WorkBuddy 部署在本地环境里跑,有几个经验值得分享。
算力规划要留够余量。本地部署意味着推理资源自己出,如果是自建机器,内存和显存最好按模型的建议配置再往上留一截。不然并发任务一起来,响应延迟会非常明显,本来一个几秒的任务被拖到半分钟,体验大打折扣。
连接器鉴权提前准备。接钉钉多维表、Obsidian 这类系统时,大多数连接器都需要配置 token 或应用凭证。建议提前去对应平台的开发者后台把密钥申请好,省得配置到一半卡住,或者为了等一个审批拖上两天。我第一次配钉钉连接器时,就是没提前申请权限,结果流程跑到一半被卡住,后来把权限补上才跑通。
目录结构保持清晰。WorkBuddy 的工作区、知识库、日志目录尽量分开。日志和临时文件如果全部堆在默认目录里,后面排查问题会很痛苦。尤其是做自动化任务比较多的时候,日志文件增长很快,不分开管理的话半个月就能把你目录搅成一团乱麻。
版本升级前先备份。如果通过命令行或脚本方式更新,升级前对配置目录做一次完整备份。模型能力在迭代,工具本身也在迭代,遇到版本不兼容的时候有个回滚点会安心很多。别问我怎么知道的,有一次升级后 Skill 配置读不出来了,幸亏备份及时,不然全部重新来一遍的滋味不好受。
5. 这几天实测遇到的坑与排查方法
5.1 模型切换后没生效
有几次我在一个对话里切成 Hy4 preview,但后续对话的输出风格还是一股 Hy3 味。排查下来发现,旧的消息上下文还挂在对话里,模型是在原上下文基础上继续回答的。遇到这种情况,最简单的办法是先开一个新对话,再切换模型。如果新对话里模型选择器显示正常,基本就没问题了。
另外还有一个细节:有些设备会在后台做模型列表的缓存,刚更新版本或者刚开放新模型时,列表里可能看不到 Hy4 preview。这时候不要反复重装软件,先试试下拉刷新模型列表,或者清理一下客户端的缓存数据重新登录。多数情况下是缓存问题,不是账号问题。
5.2 限免额度显示异常
活动刚上线那两天,不少用户在用量页面看到的数据和实际体验对不上。我的处理方式是先看模型选择器上的标识,再跑一次特征明显的任务验证。如果确认实际在用的是限免模型,就不必太担心显示问题。当然如果长时间不刷新,可以重启客户端或者重新登录一次,让配额信息重新同步。
这里多提一句:如果你在用量列表里看到某个模型出现了一条“0.00”的记录,不用担心,那一般就是限免额度的抵扣记录。随手截图保存一下也行,万一后面账单有异议,手里有凭证比空口解释省事得多。
5.3 自定义指令在部分任务里不生效
这个问题我踩过几次。后来发现原因是有些任务模板里自带了系统提示词,把我写的自定义指令给覆盖了。解决办法是不要把所有规则都堆在自定义指令里,对于关键任务,直接在任务描述里把最重要的约束写清楚。比如“输出必须是表格,含一列风险等级”,直接在任务文本里写,比只依赖全局自定义指令更靠谱。
优先级可以这么记:任务描述覆盖自定义指令,自定义指令覆盖模型默认行为。搞清楚这个顺序之后,遇到“指令没生效”的情况,先检查这个任务是不是走了一个自带提示词的任务模板。如果是,把关键要求写进任务描述里即可。不要试图用一个全局自定义指令管所有任务,那既不现实,也不好维护。
5.4 连接器同步异常
用连接器做定时同步时,偶尔会遇到同步失败或者数据不同步。经验是先看连接器的日志,确认是鉴权过期、接口限流还是字段映射变化。如果是鉴权过期,去对应平台重新授权就行;如果是接口限流,把同步频率降下来就好;如果是字段映射变化,得去更新映射配置。这类问题通常不是 WorkBuddy 本身的问题,更多是外部系统接口变动引起的,别一上来就重装工具。
我还习惯给每个重要的自动化任务做一次最小化验证:先用两条假数据手动触发一遍,看输出是否符合预期,再放到生产环境里定时执行。这个习惯帮我避免了不少半夜被任务异常叫醒的情况。连接器这种跨系统的东西,最大的风险就是“这边看着没问题,那边已经断了很久”,定时验证能把这个空窗期缩短到最小。
另外补充一个观察:如果同一时间有多个连接器都开始执行同步任务,很容易撞上外部系统的限流阈值。建议把定时任务的执行时间错开几分钟,别让所有任务都挤在整点跑。这个细节我在最开始没注意,后来把同步时间从“每小时整点”改成“每小时第15分钟、第35分钟、第55分钟”,同步成功率明显提高。模型限免是好事,但基础设施不稳,再强的模型也白搭。
这次双模型限免,我最大的体会是:工具在变,模型在迭代,但真正决定效率上限的,还是你有没有把工作流理清楚。限免期是很好的试错窗口,别光顾着“白嫖”新模型的体验,趁着这段时间把 WorkBuddy 的 Skill、连接器、自定义指令都配置到位,把任务分清楚模型,才是把这波福利变成长期生产力的正确姿势。
最后再分享一个小技巧:限免期建议你每周固定抽半小时,把当周用到的所有任务类型过一遍,看每个任务用哪个模型效果最好,记录成一个“模型选型表”。等限免一结束,免费的额度收回去了,你手上的这份实测记录才是真正有价值的东西。到时候要付费也付得明白,不付费也知道该怎么降级替代,心里完全不慌。