整理收藏夹那天下班前,我数了一下:光“提示词”分类就有84条收藏,什么“一学就会的写作咒语”“万能角色扮演Prompt”“让AI说出人话的5个高频句式”,每条底下都是几千赞。我当时收藏的理由都一样:怕以后要用的时候写不出来。可真到用的时候呢?我打开对话框,面对一个空白输入框,前前后后打了三版还是觉得不对,最后又回去翻收藏夹,翻完更懵了。
问题出在哪?后来我想明白了:我把提示词当成了咒语,可它实际上是任务说明书。咒语是背下来念就行,说明书必须根据你自己的项目现写。你收藏的那84条,是别人项目的说明书:里面绑定了他的产品、他的客户、他的语气偏好、他那套模型的版本。字段不换,场景一换就直接失效。
这篇文章不教你怎么攒提示词,只讲一个我用了大半年的四项框架,以及它怎么在写文案、写代码、调绘图模型、搭Agent时反复复用。看完你会理解,为什么“收藏84条提示词,不如背下这1个万能公式”。
1. 先搞懂提示词的底层逻辑:你面对的是一个容易脑补的白纸员工
1.1 提示词到底在解决什么问题
对话式模型的本质,是一个做完海量文本续写训练的机器。你给一句话,它按概率续下一句,一路续到你觉得“像个能干活的人”。这意味着它没有任何立场、没有你的个人偏好、不知道你的隐私边界,也没有人类那种“常识”的默契。
“帮我写篇文章”——在它看来,这已经是一个完整的任务了。它不会追问你:发在哪个平台?给谁看?多长?什么调性?它只会按训练数据里最常见的那类文章续写,也就是“四平八稳的AI腔调文章”。这就是为什么很多人觉得AI写的东西都带着一股“塑料味”:不是模型不行,是你给的信息太少,它只能猜一个最安全的大众答案。
把模型当成一个“新入职的员工”来想就通了:他能力很强,但对你们公司的潜规则一无所知。你不告诉他要交付给谁、按什么格式、忌讳什么词,他一定先按自己习惯的方式干。提示词工程,说白了就是“结构化地说清楚一个任务”。
1.2 为什么“别人的咒语”救不了你的场景
市面上的“万能提示词”收藏帖,基本可以归成两类:一类是角色扮演套话(“你是资深营销专家,请……”),另一类是带着具体产品的爆款模板(“帮我写小红书文案,产品是XX护肤霜,目标是宝妈,要煽情”)。这些模板在原作者手里是有效的,但你抄过来时,三个变量已经变了:
- 问题变了。原作者解决的是“护肤霜卖给宝妈”,你要解决的是“茶叶卖给中年男”。字段不同,结果就是另一篇文章。不信你试试把“护肤霜”直接换成“普洱茶”跑一遍,大概率得到一篇驴唇不对马嘴的种草文。
- 模型变了。收藏帖往往不标注它用的是哪一代模型。同一个prompt,在不同型号上的表现差异很大。你照抄时用的工具可能和原作者差两代,效果自然不可复制。
- 你没有判断标准。84条模板之间没有体系。遇到新任务,你根本不知道应该选哪条;生成之后,你也不知道它到底算好还是算坏。于是你只能陷入“换个措辞重试”的撞运气循环,而不是“做一次有依据的修正”。
想通这三点后,我把收藏夹全删了,只保留一套四要素框架。因为提示词的要义不是“背下来念”,而是“每次都能为当前任务现写一份说明书”。
2. TASK四要素:把需求翻译成模型能执行的任务说明书
如果你只记住一个公式,记住这四个词:T-A-S-K(Target目标、Around背景、Steps步骤、Check校验)。巧的是,prompt的本义就是“给模型布置任务”,而TASK刚好就是“任务”的英文。
在你把细节填进去之前,先看这个填空模板。这套模板我贴了半年,写文案、写代码、画图都在用:
你是一位【身份/角色】。 任务:【一句话说清要什么交付物】。 背景:我面对的场景是【场景】;我的读者/用户是【对象】;我手上有的素材/资料是【粘贴或说明】;约束是【不能做什么、必须做什么】。 步骤:请按三步执行:1.【先做什么】;2.【再做什么】;3.【最后做什么】。 示例:请参考这种写法/结构:【给一个你认可的样例】。 校验:完成后请对照清单检查:【几条可量化的标准】;如果没达标,先说明哪条不达标,再修改。下面拆开讲每个要素,以及它为什么必须存在。
2.1 T:目标——交付物和验收标准
目标不是“写篇文章”,而是把“交付物+验收标准”写清楚。交付物指的是最终形式:一篇公众号推文、一段Python脚本、一条小红书笔记、一张图。验收标准是“怎么算合格”:多少字、包含哪几个要点、标题不超过多少字、代码要能在哪个环境跑通。
为什么验收标准这么重要?因为模型无法感知“你觉得好不好”,但它能测量“字数是否达标、是否包含3个技巧、是否用了你禁止的词”。你把主观审美翻译成可量化指标,它才能自我检查。我见过太多人写“我要你写得更有趣一点”,模型只会把“有趣”理解成加感叹号和网络梗,真正的有趣它无从判断。
2.2 A:背景——让模型站在你的坑里看问题
背景是四个要素里最容易被漏掉、也性价比最高的一项。模型不知道你是谁、不知道读者是谁、不知道平台规则、不知道你忌讳什么。它默认的“读者”是训练数据里的平均网友,默认的“语气”是平均帖子的语气,默认的“价值观”是平均说话人的价值观——而这些默认值,几乎从来不是你想要的。
背景的正确写法是“差异信息”:我是咖啡新手,完全没买过手冲壶;读者是每天加班到九点的白领;发布平台是公众号,不能超过1400字;不要出现老掉牙的比喻;素材里提到的产品型号不能写错。这些信息模型猜不到,而每一条都在把输出往你要的方向拽。
很多人以为背景等于角色扮演,其实角色扮演只是背景里的一小项。更值钱的是“场景约束+素材投喂”。给素材时最好明确说“下面是我们的产品资料,用里面的事实,不要自己编”——这一句话能大幅减少AI一本正经编数据的概率。
2.3 S:步骤——告诉模型“按我的套路来”
模型接到任务后,会本能地选它训练数据里最常见的那条路径,也就是“一鼓作气输出终稿”。但你的工作流往往不是这样:你可能想先列大纲、先出三个标题供你挑选、先设计方案再写代码。这些“我习惯怎么做”的流程,模型全部不知道,必须写在步骤里。
步骤用“先…再…最后…”这种显式编号最有效。同时,给方法偏好:写文章用金字塔结构,写方案用AIDA,拆故障用RCA。这些术语模型都懂,直接点名就行。
S里面还藏着一张王牌:示例(few-shot)。给一个“你想要的正确输出样例”,比用一百个形容词描述都有效。比如写客服话术,直接贴一段“我们认可的回复语气”样例;画图,贴参考图描述。模型对示例的模仿能力,远强于对抽象形容词的理解。这条一定要用。
2.4 K:校验——防止模型一本正经地跑偏
模型输出完之后不会自我检查,除非你把“检查”作为任务的一部分写进去。校验有两种写法:
第一种是输出前自检清单。在prompt末尾写“完成后请核对:是否覆盖背景里提到的3个要素?是否控制在1400字以内?是否有事实性编造?如果发现哪里不达标,请直接修改,而不是带着问题交付”。相当于让模型在交付前多走一遍自查,很多低级错误在这一步就被拦下了。
第二种是表面歧义防错。自然语言天然有歧义,AI绘图圈流传着一个“鹈鹕骑自行车”测试:输入“一只鹈鹕骑自行车”,有的模型真的画出“一个人骑在一只鹈鹕背上”——因为它把“骑”的主语理解错了。文字模型同样存在理解偏差。让模型用你的标准先过一遍,等于多一道质检。
2.5 一张表看懂烂Prompt和TASK Prompt的差别
| 维度 | 烂Prompt | TASK Prompt |
|---|---|---|
| 目标 | 帮我写个朋友圈文案 | 为冷萃壶写朋友圈文案,受众是爱喝咖啡的上班族,3行以内,结尾提问引导评论 |
| 背景 | 无 | 我卖的是家用冷萃壶,主打省钱、方便,语气自然不喊口号,不提竞品 |
| 步骤 | 无 | 先列2个核心卖点,再写正文,最后压缩到60字内 |
| 校验 | 无 | 检查是否包含“省钱”和“方便”两个卖点,是否3行以内,是否落俗套 |
3. 同一套公式,我实测跑通了文案、编程和文生视频
公式背出来不算会,能换场景复用才算。下面三个场景都是我用TASK公式一步步填出来的实战记录。
3.1 场景A:让AI一次性写出可发布的公众号文章
有读者在后台问:想用扣子搭一个自动生成公众号文章的智能体,该把什么样的提示词写进人设?答案依然是TASK公式,只是把它固化成常驻指令。
我在调试时用的完整prompt是这样的:
你是一位有8年公众号运营经验的编辑。任务:写一篇公众号推文,主题是“下班后如何不被手机绑架”。 背景:发布对象是25-35岁、下班后疲惫但想自救的职场白领;我公众号的调性是真诚、不说教、给方法;文章需要包含3个能立刻执行的时间管理技巧、1个作者亲历的反面例子、文末一个互动问题。约束:不超过1400字,不出现“时间就像海绵里的水”这类陈词滥调。 步骤:1. 先给我3个备选标题,我选完再继续;2. 按“痛点场景→3个技巧→个人反例→行动清单”的结构写正文;3. 压缩到1400字以内,每个技巧的小标题加粗。 校验:完成后核对:标题是否有冲突感和信息量?技巧是否不需要额外工具就能落地?是否有一句可直接截图引用的金句?不达标就说明原因并重写。你注意看,每一行都对应公式的一个框。最值钱的是步骤里的“先给我3个备选标题,我选完再继续”——它把一次大输出切成了两轮,避免你嫌弃整篇推文却被迫全部推翻。这个技巧在长文任务里都能用:先让模型给大纲、给标题、给结构,你确认后再展开。因为输出被切小,纠错成本急剧下降。
3.2 场景B:程序员给AI下任务,第一步先写运行环境
我见过很多程序员抱怨“AI写的代码跑不通”,细聊之后发现,他们的prompt往往只有一句“写一个批量转换markdown为docx的脚本”。这句话的问题在于:模型不知道你的操作系统、Python版本、已安装的库、是否需要断点续跑,它只能按它见过的通用路径写,结果八成跟你的环境冲突。
用TASK公式重写后:
你是一位Python中级工程师。任务:写一个脚本,把【folder A】下的所有markdown文件批量转成docx,保留标题层级和表格。 背景:运行环境是Windows 10、Python 3.11;优先用python-docx实现,不依赖pandoc;文件夹约200个文件,需要支持处理过的文件自动跳过。 步骤:1. 先列出你打算采用的库和整体模块划分,我确认后再写代码;2. 把文件遍历、格式转换、错误日志分别写成独立函数;3. 最后给一个命令行调用示例,并列出两个边界测试思路(空目录、文件名含空格)。 校验:完成后检查:是否处理了UTF-8编码问题?每个文件是否有独立try-except,避免单个报错中断整体?是否打印清晰日志?不确定的地方直接标注。这里的关键改动有两个:背景里写清楚运行环境,这一条彻底消灭了“版本不兼容”这类低级问题;以及步骤里要求先列设计再写码,逼着模型输出可维护的代码,而不是一坨能跑但看不懂的脚本。对编程任务来说,“可测试性”就是校验框里的验收标准。
3.3 场景C:文生图/文生视频里的“鹈鹕骑自行车”陷阱
文生图模型对中文的理解这几年进步很大,但有一个坑始终存在:修饰关系歧义。最典型的例子就是测试界流传的“鹈鹕骑自行车”:你写“一只鹈鹕骑自行车”,有些模型会理解成“一个人骑着鹈鹕自行车”——因为“骑”的主语在歧义句里被丢给了隐含的人。这不是模型笨,而是自然语言在压缩信息时会牺牲主体的修饰关系。
TASK公式解决这个问题的办法,是把主体关系写进目标,再加上校验兜底。画图时我通常这样写:
一张卡通插画:一位穿黄色雨衣的小女孩,骑着一辆明黄色自行车,车筐里坐着一只白色鹈鹕。背景是雨后街道,暖色调,远景构图,细节丰富。 约束:不出现文字水印;主体关系必须是小女孩骑车、鹈鹕坐车筐。看到没有,我甚至没有用“鹈鹕骑自行车”这个天然歧义短语,直接改成“小女孩骑车,鹈鹕坐车筐”,主体关系在语法顺序上就被锁死了。文生视频的提示词也一样:目标是5秒短视频,背景写清画面内容,步骤里写清镜头运动,校验里写清“不要出现手部变形、不要出现多余人物”。国产视频模型对中文提示词的理解已经不错,但你在公式里多花十秒把“主体关系、镜头、负面清单”写死,生成第一版就能用的概率会翻倍。
4. 真正的高手都在用“校验-反馈-修正”回路,而不是一次写对
4.1 打磨剧本:一次完整的优化链路
说句实在话:写作类的提示词,第一版能直接用的概率极低。日常写作工作流里,我反而会故意把prompt写得“留有余地”——目标清晰,但要求模型先给初稿,然后用反馈回路一点点逼到及格线以上。
用打磨剧本对话举个实际例子:
- 第一版prompt(出初稿):用TASK公式写一次“把这段父子对话改得更自然”。它给了我一个基本能用的版本,但台词偏书面。
- 第一轮反馈(纠偏):指明位置、给改法、给参考例子。我写的是:“第5-8句不像真人说话,太文艺。把台词改成北京口语,句长不超过15个字。参考这句:爸,您别老盯着我碗里的,先吃您的。”模型改完明显落地。
- 第二轮反馈(提节奏):“第12句之后铺垫太长,直接删掉,从父子争吵的最高点切入,用潜台词代替解释。”它把交锋密度提上来了。
- 第三轮反馈(收官):“结尾改成开放式反问,不要收束结论。”最终版本我几乎没再动。
这条路跑熟之后,我总结出一条反馈铁律:反馈里必须同时包含“坏在哪、希望改成什么样、给一个参照物”三样东西。只说“不行,再改改”,模型只能继续猜你的审美;带参照物的反馈,一次顶三次重试。这也对应大家聊提示词时说的“上策”和“下策”:上策是给约束、给示例、给步骤,下策是删掉重来碰运气。
4.2 让模型先复述计划再执行,能省掉一半返工
还有一个屡试不爽的技巧:在prompt末尾加一句“执行前先向我复述你的计划,我确认后再输出”。这不是废话,而是把“校验”前置了。
模型在被要求复述计划时,等于被迫再过一遍自己的设计逻辑,很多明显跑偏的思路在复述阶段就暴露了。比如你让它写方案,它可能在复述计划时说“我会从行业趋势讲起”——你一听就知道方向错了,直接打断纠正,而不是等它写完一千字再全盘否定。一个对话里塞进几次这种前置校验,效果远好于“生成→嫌弃→重来”。
顺带说一句,市面上那些提示词优化插件,本质上就是帮你自动完成这套“校验-反馈-修正”循环。工具可以加速循环,但循环的骨架,还是TASK四个框。
5. 公式用熟了以后:把它固化进系统提示词和Agent
5.1 把TASK当协议写进人设
如果你只是偶尔聊一次天,手动填TASK就够了。但如果你在搭Agent、搭个人AI工作台,或者用扣子这类平台做公众号写作机器人,你完全可以把这套公式固化成人设/系统提示词,让每个新对话都默认遵守。
我当时给公众号智能体写的“人设与回复逻辑”只有一小段:
你是公众号写作助手。用户每次给出主题和素材后,按以下协议工作: 1. 先明确交付物与验收标准(字数、结构、语气),缺失时反问用户; 2. 补全背景和约束,素材不足时向用户要素材; 3. 先给结构和标题,用户确认后再展开正文; 4. 任务完成后逐条对照验收标准自查,并向用户汇报修改点。你会发现,这段话本质上就是TASK公式,只不过从“一次性填空”变成了“常驻工作协议”。把这段协议放进系统提示词后,我几乎不再手写长prompt了,每次只说“今天写篇关于XX的”,Agent会自己走完目标-背景-步骤-校验的循环。不少团队还会把类似协议写进Spring AI项目的system prompt配置里,由后端统一维护提示词版本。
5.2 关于“泄露提示词”,我的态度是:抄结构,不抄内容
最近“AI编程提示词泄露”“Cursor提示词泄露”这类话题讨论度很高,不少人在后台求一份“泄露版”。我的态度一直很明确:泄露出来的提示词,是它所在项目的产物,高度依赖模型版本、代码库上下文、用户习惯。直接粘贴过去,大概率得到一堆和环境冲突的次品。
但你完全可以偷它的结构。任何一份工业化程度高的提示词,拆开来看都逃不出TASK:它一定会声明目标和验收方式,一定会塞背景约束,一定会规定执行步骤,一定会设计校验环节。所以与其追着“泄露版”跑,不如把TASK四要素背下来,对着自己的项目填一遍。这才是把别人的提示词变成自己能力的方式。
写在最后的话,是我个人真实的体会。删掉那84条收藏后,我没有立刻变厉害,前两周甚至更慢——每次填四个框,比随口丢一句“帮我写个XX”啰嗦多了。但第三周开始,速度回来了,而且第一版质量明显上了一个台阶。后来哪怕是用绘图模型,我脑子里也只剩四个框:目标、背景、步骤、校验。提示词从来不是靠背,是靠结构。你收藏库里那些“无敌咒语”,本质上是别人用结构赢来的结果;你要做的,是背起结构本身。