LoopX ML Experiment能力实战:假设、证据与提升/停止门槛一图看懂
【免费下载链接】loopxLong-horizon agent control plane for durable, governed work across Codex, Claude Code, and other harnesses.项目地址: https://gitcode.com/GitHub_Trending/lo/loopx
LoopX ML Experiment 是 LoopX 控制平面内置的「ML 实验领域能力包」:它把一次模型迭代拆解为**假设(hypothesis)→ 证据(evidence)→ 判定(提升/停止门槛)**三步闭环,用紧凑、公开安全的账本记录每轮实验,并默认拒绝自动启动或停止任何训练任务——让你(而不是 Agent)掌握最后的发布决定权。
🗺️ 一图看懂:200+ 小时实验轨迹
先看图说话。下面这张脱敏后的轨迹图,展示了 LoopX 在一次 200+ 小时的真实实验弧中如何保持决策线清晰:哪些假设被保留、哪些证据被采信、哪些无效谱系被标记、哪些复现实验正在运行、哪些候选触发了提升或停止门槛——全部在同一张图上可见。
它的设计意图很直白:长时间运行的实验不应该依赖人的记忆,而应该依赖一份可审计的状态账本。
🧠 三个核心概念:假设、证据、门槛
LoopX ML Experiment 围绕 loopx/domain_packs/ml_experiment.py 中的三个契约 schema 展开:
| 契约 | 回答的问题 | 关键状态 |
|---|---|---|
hypothesis_ledger_v0假设台账 | 我为什么做这个实验? | active / supported / weakened / retired |
dataset_window_contract_v0数据窗口契约 | 基线和候选是不是在同一窗口对比? | 窗口匹配才算数,缺失窗口标记为「结论不可信」 |
experiment_replan_v0重规划预览 | 下一步该继续、扩窗还是放弃? | 只给建议,不启动任务 |
⚖️ 提升/停止门槛:一张判定表讲清楚
最常被问到的问题是:「指标涨了,是不是就该上线?」LoopX 的答案是——还要看护栏。核心判定逻辑见 loopx/domain_packs/ml_experiment.py:
| 实验结果 | 护栏状态 | 判定结论 | 推荐动作 |
|---|---|---|---|
| 主指标提升 | clean | promote提升资格 | 经 Owner/Registry 门禁后扩大窗口或交接 |
| 主指标持平 | 任意 | retire_or_replan停止/重规划 | 放弃候选,或设计机制上不同的新假设 |
| 主指标回退 | 任意 | no_promote不提升 | 停止该方向,并避免「近邻实验」盲目重试 |
| 指标待出(监控中) | 任意 | monitor继续观察 | 轮询到同窗评估结束再下结论 |
| 护栏failed | failed | blocked被护栏拦截 | 先修护栏,再谈探索 |
| 任务失败/中止 | — | needs_repair需修复 | 修复启动或评估路径后再重试 |
两个防坑设计值得注意:
- 训练集指标只能当护栏用(
train_metrics_are_guardrails_only):训练曲线好看 ≠ 可以上线,结论必须在对齐的评估窗口上产生。 - 失败要归因:失败行会带上紧凑的失败标签(如「checkpoint 缺失」「环境路径错误」),而不是把原始日志塞进状态里,避免 Agent 拿着一堆噪声重复试错。
🔒 安全默认:默认关闭,权限三级
LoopX ML Experiment 默认是off + advisory形态(见 build_ml_experiment_domain_pack_contract),能力分级如下:
| 自主级别 | 能做什么 | 不能做什么 |
|---|---|---|
suggest_only | 发现「这像个 ML 实验」并建议开启 | 不写实验结论 |
advisory | 写紧凑结果、假设台账、重规划建议 | 不启动/停止/重启任务、不同步生产 |
delivery | 在目标边界、配额与门禁内执行授权动作 | 仍须显式授权 + 配额 + 预检 + 回写 |
所有输出都带launch_actions_enabled=false、production_actions_enabled=false,并且会把私有路径、凭据类内容自动脱敏为redacted:<digest>句柄——账本可以公开分享,敏感信息进不了状态。实验状态默认落盘到项目本地的.loopx/domain-state/<goal-id>/ml_experiment/ledger.jsonl(项目级、gitignore),不污染核心控制平面。
🚀 快速上手:一条 preview 命令试跑
算法同学可以零风险试用 advisory 形态——preview不写状态、不启动任何东西(完整示例见 docs/product/domain-capability-packs.md):
loopx ml-experiment preview --format json \ --experiment-id exp_preview_v1 \ --primary-metric offline_auc \ --baseline-value 0.421 --candidate-value 0.437 \ --guardrail-status clean \ --train-window train_2026w24 --eval-window eval_2026w25 \ --hypothesis-id h_route_mix_v1 \ --mechanism-family "candidate retrieval mix" --route route_mix \ --positive-evidence offline_eval_delta_positive \ --next-candidate holdout_eval返回的四段结构正好对应本文的主线:结果判定 → 数据窗口 → 假设台账 → 重规划建议。
📁 延伸阅读与源码导航
- 能力包设计文档:docs/product/domain-capability-packs.md
- ML 实验领域包源码:loopx/domain_packs/ml_experiment.py
- CLI 命令注册(preview / volc-task-packet / volc-result-ledger):loopx/cli_commands/ml_experiment.py
- 顶层兼容入口:loopx/ml_experiment.py
- 主指标升降判定实现:classify_primary_metric_delta
- 提升/停止结果路由实现:_volc_result_outcome
一句话总结:LoopX ML Experiment 把「假设—证据—门槛」固化为默认关闭、可审计的领域能力包,让你在长时间模型迭代中既能看清提升路径,也守得住停止线。
【免费下载链接】loopxLong-horizon agent control plane for durable, governed work across Codex, Claude Code, and other harnesses.项目地址: https://gitcode.com/GitHub_Trending/lo/loopx
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考