- AI 技能
- 人工智能
【免费下载链接】marketingskills
Marketing skills for Claude Code and AI agents. CRO, copywriting, SEO, analytics, and growth engineering.
这篇技术指南围绕开源仓库 marketing-skills 中ab-testing技能的核心参考文档 test-templates.md 展开,系统讲解一套覆盖"计划 → 运行 → 分析 → 复盘 → 沉淀"全生命周期的 A/B 测试文档模板。你将掌握 7 个可直接复制使用的结构化模板(测试计划、结果文档、测试仓库条目、快速简报、利益相关者更新、优先级记分卡、假设银行),并理解它们与技能主文件 SKILL.md 中假设框架、样本量、指标分层、统计显著性等实验方法论之间的对应关系,从而为自己的增长实验项目建立可复用、可检索、可审计的文档体系。
模板体系总览
在开始写任何实验文档之前,先明确这套模板的定位:它不是零散的笔记格式,而是一套贯穿实验生命周期的文档管线。test-templates.md在开篇的 Contents 中列出 7 个模板,覆盖三个阶段的职责:
| 阶段 | 模板 | 职责 |
|---|---|---|
| 实验前 | Test Plan Template | 把想法固化为可执行的测试计划 |
| 实验前 | Quick Test Brief Template | 轻量记录不需要完整文档的简单测试 |
| 实验前 | Experiment Prioritization Scorecard | 决定先跑哪个测试 |
| 实验前 | Hypothesis Bank Template | 持续收集测试想法形成后备池 |
| 实验中 | Stakeholder Update Template | 向利益相关者同步运行状态 |
| 实验后 | Results Documentation Template | 完整记录结果、解读与决策 |
| 长期 | Test Repository Entry Template | 在集中位置追踪全部测试 |
技能主文件 SKILL.md 在 Documentation 一节明确要求"记录每一个测试,包括假设、变体(带截图)、结果(样本、指标、显著性)、决策与学习",并直接指向本模板文件。这意味着模板不是孤立的表单,而是 SKILL.md 所倡导的实验纪律的落地载体。
测试计划模板:把假设固化为可执行的实验方案
测试计划模板是整个体系的起点,它把一次实验从"我们试试看"升级为"我们验证什么、怎么验证、如何判定成败"的完整方案。模板原文如下:
# A/B Test: [Name] ## Overview - **Owner**: [Name] - **Test ID**: [ID in testing tool] - **Page/Feature**: [What's being tested] - **Planned dates**: [Start] - [End] ## Hypothesis Because [observation/data], we believe [change] will cause [expected outcome] for [audience]. We'll know this is true when [metrics]. ## Test Design | Element | Details | |---------|---------| | Test type | A/B / A/B/n / MVT | | Duration | X weeks | | Sample size | X per variant | | Traffic allocation | 50/50 | | Tool | [Tool name] | | Implementation | Client-side / Server-side | ## Variants ### Control (A) [Screenshot] - Current experience - [Key details about current state] ### Variant (B) [Screenshot or mockup] - [Specific change #1] - [Specific change #2] - Rationale: [Why we think this will win] ## Metrics ### Primary - **Metric**: [metric name] - **Definition**: [how it's calculated] - **Current baseline**: [X%] - **Minimum detectable effect**: [X%] ### Secondary - [Metric 1]: [what it tells us] - [Metric 2]: [what it tells us] - [Metric 3]: [what it tells us] ### Guardrails - [Metric that shouldn't get worse] - [Another safety metric] ## Segment Analysis Plan - Mobile vs. desktop - New vs. returning visitors - Traffic source - [Other relevant segments] ## Success Criteria - Winner: [Primary metric improves by X% with 95% confidence] - Loser: [Primary metric decreases significantly] - Inconclusive: [What we'll do if no significant result] ## Pre-Launch Checklist - [ ] Hypothesis documented and reviewed - [ ] Primary metric defined and trackable - [ ] Sample size calculated - [ ] Test duration estimated - [ ] Variants implemented correctly - [ ] Tracking verified in all variants - [ ] QA completed on all variants - [ ] Stakeholders informed - [ ] Calendar hold for analysis date假设部分:与技能主文件的假设框架严格对齐
测试计划中的 Hypothesis 五句式结构与 SKILL.md 的假设框架完全一致:
Because [observation/data], we believe [change] will cause [expected outcome] for [audience]. We'll know this is true when [metrics].SKILL.md 用一个强弱对比示例说明了这套结构的分量:
- 弱假设:"Changing the button color might increase clicks."("改按钮颜色可能增加点击")——没有观察依据、没有量化预期、没有目标受众、没有衡量指标。
- 强假设:"Because users report difficulty finding the CTA (per heatmaps and feedback), we believe making the button larger and using contrasting color will increase CTA clicks by 15%+ for new visitors. We'll measure click-through rate from page view to signup start."(依据热力图与用户反馈中的观察,预期新访客的 CTA 点击率提升 15% 以上,并以页面浏览到注册开始的点击率衡量)。
把强假设填进模板时,Because段应引用真实的数据或观察(分析、客户研究、竞品、工单、热力图),We'll know this is true when段应指向下方 Metrics 中定义的主指标,形成"假设—指标"的闭环。技能评估用例(evals.json 中 eval 1)也明确要求:给定"15,000 月访问量、3.2% 注册率"等上下文时,必须按此框架构建假设,并定义主指标、次指标与护栏指标。
测试设计表:每个字段的取值与含义
| 字段 | 可取值 / 含义 |
|---|---|
| Test type | A/B(单一变更双版本)、A/B/n(多版本)、MVT(多变体组合)。SKILL.md 的测试类型表显示 MVT 需要"Very high"流量,A/B/n 需要"Higher"流量,普通 A/B 只需"Moderate" |
| Duration | 预估运行周数。依据样本量与日流量的比值计算(详见下文"样本量"一节) |
| Sample size | 每个变体所需样本量,而非总流量。它由基线转化率、最小可检测效应(MDE)、显著性水平(通常 95%)、统计功效(通常 80%)四个输入决定,可查 sample-size-guide.md 的速查表 |
| Traffic allocation | 默认 50/50;保守方案可用 90/10、80/20 限制坏变体的风险;也可采用小流量起步再逐步放量的 ramping 策略(见 SKILL.md 流量分配一节) |
| Tool | 测试工具名(如 PostHog、Optimizely、VWO 等) |
| Implementation | Client-side(JS 在页面加载后修改,实施快但可能有闪烁)或 Server-side(渲染前确定变体,无闪烁但需要开发工作量)。SKILL.md 列出了两类实施各自的代表工具 |
变体设计:一次只测一件事
Variants 一节要求 Control 描述当前状态,Variant 列出每一项具体变更并附 Rationale。这与 SKILL.md 的核心原则"Test One Thing——每测只改变一个变量,否则你不知道是什么起了作用"直接呼应。SKILL.md 同时给出"What to Vary"参考表,帮助你判断什么值得作为变更点:
| 类别 | 示例 |
|---|---|
| Headlines/Copy | 信息角度、价值主张、具体程度、语气 |
| Visual Design | 布局、颜色、图片、层次结构 |
| CTA | 按钮文案、大小、位置、数量 |
| Content | 包含的信息、顺序、数量、社会证明 |
指标分层:主指标定成败、次指标解释原因、护栏指标防伤害
Metrics 一节的三层结构对应 SKILL.md 的指标选择框架:
- Primary(主指标):唯一决定成败的指标,必须直接绑定假设与业务价值。模板要求同时记录其计算定义、当前基线和最小可检测效应——这三个值正是样本量计算的输入。
- Secondary(次指标):解释主指标为何变化。SKILL.md 的示例:定价页测试主指标是计划选择率,次指标是页面停留时间与套餐分布。
- Guardrails(护栏指标):不应变差的指标。SKILL.md 示例中定价页测试的护栏指标是支持工单数与退款率;并明确"若护栏指标显著变负,应停止测试"。
三层指标在技能评估用例中同样被反复要求(eval 1 要求定义主/次/护栏指标,eval 5 针对加长注册表单的测试要求用三层框架分析"转化数量与线索质量"的权衡)。
上线前检查清单:把纪律写进流程
Pre-Launch Checklist 的 9 项既是执行清单,也是 SKILL.md "Running the Test" 章节 Pre-Launch Checklist 的完整版。其中"Calendar hold for analysis date"(为分析日期预留日历)一项尤为关键——它把分析环节提前锁定,避免测试结束后被搁置。清单还隐含了样本量先行、跟踪验证、全变体 QA 等硬性要求。
结果文档模板:用证据链支撑复盘决策
结果文档模板是实验完成后的正式记录,它把 SKILL.md 的分析清单转化为结构化表格。模板原文如下:
# A/B Test Results: [Name] ## Summary | Element | Value | |---------|-------| | Test ID | [ID] | | Dates | [Start] - [End] | | Duration | X days | | Result | Winner / Loser / Inconclusive | | Decision | [What we're doing] | ## Hypothesis (Reminder) [Copy from test plan] ## Results ### Sample Size | Variant | Target | Actual | % of target | |---------|--------|--------|-------------| | Control | X | Y | Z% | | Variant | X | Y | Z% | ### Primary Metric: [Metric Name] | Variant | Value | 95% CI | vs. Control | |---------|-------|--------|-------------| | Control | X% | [X%, Y%] | — | | Variant | X% | [X%, Y%] | +X% | **Statistical significance**: p = X.XX (95% = sig / not sig) **Practical significance**: [Is this lift meaningful for the business?] ### Secondary Metrics | Metric | Control | Variant | Change | Significant? | |--------|---------|---------|--------|--------------| | [Metric 1] | X | Y | +Z% | Yes/No | | [Metric 2] | X | Y | +Z% | Yes/No | ### Guardrail Metrics | Metric | Control | Variant | Change | Concern? | |--------|---------|---------|--------|----------| | [Metric 1] | X | Y | +Z% | Yes/No | ### Segment Analysis **Mobile vs. Desktop** | Segment | Control | Variant | Lift | |---------|---------|---------|------| | Mobile | X% | Y% | +Z% | | Desktop | X% | Y% | +Z% | **New vs. Returning** | Segment | Control | Variant | Lift | |---------|---------|---------|------| | New | X% | Y% | +Z% | | Returning | X% | Y% | +Z% | ## Interpretation ### What happened? [Explanation of results in plain language] ### Why do we think this happened? [Analysis and reasoning] ### Caveats [Any limitations, external factors, or concerns] ## Decision **Winner**: [Control / Variant] **Action**: [Implement variant / Keep control / Re-test] **Timeline**: [When changes will be implemented] ## Learnings ### What we learned - [Key insight 1] - [Key insight 2] ### What to test next - [Follow-up test idea 1] - [Follow-up test idea 2] ### Impact - **Projected lift**: [X% improvement in Y metric] - **Business impact**: [Revenue, conversions, etc.]样本量达成度:分析的第一道闸门
Results 章节先于一切结果展示 Sample Size 表,计算每个变体"实际样本 / 目标样本"的百分比。这与 SKILL.md 分析清单的第 1 条一致:"是否达到样本量?若未达到,结果只能视为初步结论。"如果实际样本显著低于目标,即使数字看起来漂亮,也不能作为结论依据。
主指标与统计显著性:区分统计显著与实践显著
主指标表格要求同时填写变体值、95% 置信区间(CI)和相对对照的提升。随后用两行分别记录:
- Statistical significance(统计显著性):p 值是否小于 0.05。SKILL.md 明确:95% 置信度即 p < 0.05,意味着结果有小于 5% 的概率是随机波动,但它只是阈值,不是保证。
- Practical significance(实践显著性):这个提升对业务是否有意义。这是统计显著之外的第二重判断——SKILL.md 的"Effect size meaningful?"分析项要求把效果量与 MDE、项目影响对比。
技能评估用例 eval 7 提供了完整的判断场景:定价页测试运行 4 周,对照转化率 2.1%、变体 2.4%、每变体 12,000 访问者。按 sample-size-guide.md 的速查表,2.1% 基线要检测约 14% 的相对提升(0.3 个百分点),样本需求远高于 12,000/变体,因此需要同时评估"样本量是否足以支撑该效应量"与"统计显著与实践显著的区别",并给出是否上线、继续测试还是迭代的建议——这正是结果文档中这两行字段的价值。
次指标、护栏指标与分段分析:验证结论的一致性与边界
- Secondary Metrics 表:每个次指标记录对照/变体数值、变化百分比与是否显著。SKILL.md 分析清单第 4 条要求确认次指标是否与主指标一致,为"为什么生效"提供证据。
- Guardrail Metrics 表:Concern 列标记护栏指标是否变差。若护栏显著变负,应停止测试而非继续扩大。
- Segment Analysis 表:SKILL.md 分析清单第 6 条要求检查移动端 vs. 桌面端、新访客 vs. 回访者等分段差异。模板预置了 Mobile vs. Desktop 和 New vs. Returning 两张表,测试计划中的 Segment Analysis Plan 决定了这里分析哪些分段。
解读、决策与学习:把结果转化为行动
Interpretation 用三个问题(发生了什么 / 我们为什么认为如此 / 有哪些局限)强制复盘,其中 Caveats 要求记录外部因素与局限——这正好对应 SKILL.md 运行期间"Document external factors"的要求。Decision 部分明确 Winner、Action(实施变体 / 保留对照 / 重新测试)与实施时间线。Learnings 部分则要求输出关键洞察、后续测试想法与影响预估,为实验手册(Experiment Playbook)和假设银行提供原料。
测试仓库条目模板:建立全局实验台账
当多个测试并行运行时,需要一个集中位置快速检索全部测试的状态与结果。Test Repository Entry Template 提供一张可追加的汇总表:
| Test ID | Name | Page | Dates | Primary Metric | Result | Lift | Link | |---------|------|------|-------|----------------|--------|------|------| | 001 | Hero headline test | Homepage | 1/1-1/15 | CTR | Winner | +12% | [Link] | | 002 | Pricing table layout | Pricing | 1/10-1/31 | Plan selection | Loser | -5% | [Link] | | 003 | Signup form fields | Signup | 2/1-2/14 | Completion | Inconclusive | +2% | [Link] |注意示例中的语义:Loser 条目(-5%)与 Inconclusive 条目(+2%)同样值得记录。SKILL.md 强调"Significant loser 测试往往揭示值得尝试的新角度",因此台账不能只记赢家。每行 Link 应指向对应的完整结果文档,使汇总表成为实验体系的索引层。
快速测试简报模板:降低低复杂度测试的文档负担
并非所有测试都需要完整计划与结果文档。Quick Test Brief Template 专为简单测试设计,六行结构浓缩了全部关键信息:
## [Test Name] **What**: [One sentence description] **Why**: [One sentence hypothesis] **Metric**: [Primary metric] **Duration**: [X weeks] **Result**: [TBD / Winner / Loser / Inconclusive] **Learnings**: [Key takeaway]它保留了完整模板中"假设、主指标、时长、结果、学习"的五个核心要素,去掉了变体细节、分段分析等重量级章节。Result字段在测试期间保持 TBD,测试结束后回填——这让简报模板既能用于实验前的快速立项,也能在实验后转为一则浓缩记录,是文档体系中的轻量级选项。
利益相关者更新模板:在运行期管理预期
Stakeholder Update Template 解决测试运行期间如何向团队、管理层或客户同步状态的问题:
## A/B Test Update: [Name] **Status**: Running / Complete **Days remaining**: X (or complete) **Current sample**: X% of target ### Preliminary observations [What we're seeing - without making decisions yet] ### Next steps [What happens next] ### Timeline - [Date]: Analysis complete - [Date]: Decision and recommendation - [Date]: Implementation (if winner)这个模板的设计与 SKILL.md 的"运行纪律"高度一致:Preliminary observations明确标注"只陈述所见、不下结论"——这正是对窥视问题(Peeking Problem)的制度化防御。SKILL.md 指出,在达到样本量前提前查看结果并停止测试会放大假阳性率;在样本量达到前,任何"赢"都可能是随机波动,因此更新模板刻意把决策推迟到预定的分析日期。模板末尾的时间线把"分析完成 → 决策建议 → 实施"三个节点显式列出,与测试计划中的"Calendar hold for analysis date"首尾呼应。
实验优先级记分卡:用加权评分决定先测什么
当假设银行里积累了多个想法时,Experiment Prioritization Scorecard 用加权评分给出可比较的排序依据:
| Factor | Weight | Test A | Test B | Test C |
|---|---|---|---|---|
| Potential impact | 30% | |||
| Confidence in hypothesis | 25% | |||
| Ease of implementation | 20% | |||
| Risk if wrong | 15% | |||
| Strategic alignment | 10% | |||
| Total |
Scoring: 1-5 (5 = best)
这个记分卡与 SKILL.md 中的 ICE 评分(Impact + Confidence + Ease 三项各 1-10 分求平均)一脉相承:记分卡把 Impact 拆解为"潜在影响"(30%)与"战略契合"(10%),把 Confidence 保留为"假设信心"(25%),把 Ease 保留为"实施难易"(20%),并额外加入"错误风险"(15%)维度。两者都指向同一个目标:优先运行高影响、高信心、低成本、低风险的测试。SKILL.md 还建议每月按上下文变化重新评分(Re-score monthly as context changes),记分卡的 Weight 列正是为这种再评估设计的。
假设银行模板:让实验想法持续流入
Hypothesis Bank Template 是实验体系的后备池,持续收集来自数据、研究、竞品与反馈的测试想法:
| ID | Page/Area | Observation | Hypothesis | Potential Impact | Status | |----|-----------|-------------|------------|------------------|--------| | H1 | Homepage | Low scroll depth | Shorter hero will increase scroll | High | Testing | | H2 | Pricing | Users compare plans | Comparison table will help | Medium | Backlog | | H3 | Signup | Drop-off at email | Social login will increase completion | Medium | Backlog |观察(Observation)与假设(Hypothesis)两列的分开设计,正是对 SKILL.md"假设须基于推理或数据,而非'看看会发生什么'"原则的落实。Status 列(Testing / Backlog)与优先级记分卡联动:Backlog 中的条目经记分卡排序后进入 Testing。SKILL.md 的假设生成来源表可作为填充此模板的输入清单:
| 来源 | 关注什么 |
|---|---|
| Analytics | 流失点、低转化页面、表现不佳的分段 |
| Customer research | 痛点、困惑、未满足的预期 |
| Competitor analysis | 竞品有而你没有的功能、信息或 UX 模式 |
| Support tickets | 转化流程中反复出现的问题或投诉 |
| Heatmaps/recordings | 用户犹豫、rage-click 或放弃的位置 |
| Past experiments | "显著失败"的测试常揭示值得尝试的新角度 |
从实验结果中产生的"下一轮测试"想法(结果文档 Learnings 部分)也应回填此处,形成循环。
把模板嵌入持续增长实验体系
单独的模板是表单,连成流程就是增长引擎。SKILL.md 的 Experiment Loop 定义了这套体系如何自运转:
1. Generate hypotheses (from data, research, competitors, customer feedback) 2. Prioritize with ICE scoring 3. Design and run the test 4. Analyze results with statistical rigor 5. Promote winners to a playbook 6. Generate new hypotheses from learnings → Repeat模板在其中各司其职:假设银行(Hypothesis Bank)承接第 1 步,优先级记分卡承接第 2 步,测试计划承接第 3 步,结果文档承接第 4 步,而第 5 步"把赢家推广进手册"则由 SKILL.md 提供的 Experiment Playbook 条目格式承接——该格式与结果文档字段对齐:假设、样本量、结果(含 95% CI 与 p 值)、护栏指标结果、分段差异、成败原因、可复用模式、适用范围与状态。第 6 步产生的假设再次进入假设银行,循环闭合。
SKILL.md 还给出了衡量这套体系运转效率的指标,可作为测试仓库条目模板的补充追踪项:
| 指标 | 参考目标 |
|---|---|
| 每月启动的实验数 | 多数团队 4-8 个 |
| 胜率 | 成熟项目常见 20-30%(持续更高可能意味着假设偏保守) |
| 平均测试时长 | 2-4 周 |
| 假设银行深度 | 排队 20+ 个假设 |
| 累计提升 | 所有赢家的复合收益 |
在节奏上,SKILL.md 建议每周用 30 分钟检查运行中实验的技术问题与护栏指标、每两周复盘已完成实验并启动下一个、每月用 1 小时复盘实验速度/胜率/累计提升并重新排优先级、每季度审计手册中哪些模式已规模化推广。
常见错误清单:模板的每一栏都是防线
SKILL.md 的 Common Mistakes 章节总结了测试设计、执行与分析三个阶段的典型错误,模板结构正是对这些错误的系统性防御:
- 设计阶段:变更太小无法检出、一次测太多无法归因、没有明确假设——测试计划模板的 Test Design、Variants(一次一件事)与假设五句式分别对应。
- 执行阶段:提前停止、中途改变体、不核查实施——利益相关者更新模板的"不下结论"字段与 Pre-Launch Checklist 的跟踪验证项分别对应。
- 分析阶段:忽视置信区间、挑选分段、过度解读不显著结果——结果文档的主指标表(含 95% CI)、分段分析表与 Result 三态(Winner/Loser/Inconclusive)分别对应。
配套参考:样本量计算与技能协同
样本量速查与时长估算
测试计划中"Sample size"与"Duration"两个字段的取值依据在 sample-size-guide.md 中。其核心输入是:基线转化率、最小可检测效应(MDE)、统计显著性(通常 95%,α=0.05)与统计功效(通常 80%,β=0.20)。速查表示例(每变体样本量):基线 5% 时检测 10% 提升需 72,000/变体,检测 50% 提升仅需 3,100/变体;基线 1% 时检测 10% 提升需 380,000/变体。多变体(A/B/n)还需按倍数放大:3 变体约 1.5 倍、4 变体约 2 倍,并考虑 Bonferroni 校正。
时长估算公式为:Duration (days) = (Sample per variant × Number of variants) / (Daily traffic × % exposed)。例如需 10,000/变体、双变体、日流量 5,000、100% 曝光时,时长为 20,000 / 5,000 = 4 天。即使样本量足够,也建议至少运行满 1 个完整星期以覆盖一周内的日期差异(B2B 需 2 个业务周期,电商需覆盖月初月末的发薪日效应);同时避免超过 4-8 周,因为新颖性效应会消退、外部因素会介入。当样本量需求过高时,可从放大 MDE、降置信度至 90%、削减变体、合并流量、向上游测试或放弃测试改用定性数据等选项中取舍。
与其他技能的分工
模板体系并非孤立运行。SKILL.md 的 Related Skills 明确了分工边界:cro技能负责基于 CRO 原则生成测试想法(cro/references/experiments.md 按页面类型列出了首页、定价页、Demo 请求页、落地页等数百条实验假设,可直接填充假设银行);analytics技能负责测试的埋点与测量(对应测试计划中"Primary metric defined and trackable"与"Tracking verified");copywriting技能负责创建变体文案(对应 Variants 部分)。技能评估用例 eval 6 也验证了这一分工:当用户请求"为落地页写测试文案"时,应识别这是文案任务而非测试搭建任务,转而引用 copywriting 技能。
结语
test-templates.md提供的 7 个模板构成了一套完整且自洽的实验文档协议:测试计划让假设可执行,结果文档让结论有证据,台账让历史可检索,简报与更新模板降低流程负担,记分卡与假设银行让实验管线持续供血。结合 SKILL.md 的方法论约束(假设先行、单变量、统计严谨、分层指标)与 sample-size-guide.md 的量化工具,这套模板体系可以直接落地为团队或个人的 A/B 测试标准作业流程,并随实验手册的积累逐步沉淀为专属的增长模式库。
- AI 技能
- 人工智能
【免费下载链接】marketingskills
Marketing skills for Claude Code and AI agents. CRO, copywriting, SEO, analytics, and growth engineering.
相关推荐
A/B 测试文档模板体系实战指南:从实验计划、结果复盘到增长实验程序的全套可复用模板
A/B 测试文档模板体系实战指南:从实验计划、结果复盘到增长实验程序的全套可复用模板 导读 在 A/B 测试中,实验的设计质量与文档化程度往往直接决定结论能否被
AI 技能AI 插件agentic-awesome-skills A/B 测试技能实战指南:从假设设计到增长实验体系
agentic awesome skills A/B 测试技能实战指南:从假设设计到增长实验体系 A/B 测试(又称 split test、对照实验)是产品增长
AI 技能AI 插件A/B 测试样本量计算实战指南:agentic-awesome-skills 中 ab-testing 技能的样本量估算与测试时长规划全解
A/B 测试样本量计算实战指南:agentic awesome skills 中 ab testing 技能的样本量估算与测试时长规划全解 本文是 agenti
AI 技能AI 插件
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考