news 2026/9/16 14:41:12

LoopX ML Experiment能力实战:假设、证据与提升/停止门槛一图看懂

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
LoopX ML Experiment能力实战:假设、证据与提升/停止门槛一图看懂

LoopX ML Experiment能力实战:假设、证据与提升/停止门槛一图看懂

【免费下载链接】loopxLong-horizon agent control plane for durable, governed work across Codex, Claude Code, and other harnesses.项目地址: https://gitcode.com/GitHub_Trending/lo/loopx

LoopX ML Experiment 是 LoopX 控制平面内置的「ML 实验领域能力包」:它把一次模型迭代拆解为**假设(hypothesis)→ 证据(evidence)→ 判定(提升/停止门槛)**三步闭环,用紧凑、公开安全的账本记录每轮实验,并默认拒绝自动启动或停止任何训练任务——让你(而不是 Agent)掌握最后的发布决定权。

🗺️ 一图看懂:200+ 小时实验轨迹

先看图说话。下面这张脱敏后的轨迹图,展示了 LoopX 在一次 200+ 小时的真实实验弧中如何保持决策线清晰:哪些假设被保留、哪些证据被采信、哪些无效谱系被标记、哪些复现实验正在运行、哪些候选触发了提升或停止门槛——全部在同一张图上可见。

它的设计意图很直白:长时间运行的实验不应该依赖人的记忆,而应该依赖一份可审计的状态账本。

🧠 三个核心概念:假设、证据、门槛

LoopX ML Experiment 围绕 loopx/domain_packs/ml_experiment.py 中的三个契约 schema 展开:

契约回答的问题关键状态
hypothesis_ledger_v0假设台账我为什么做这个实验?active / supported / weakened / retired
dataset_window_contract_v0数据窗口契约基线和候选是不是在同一窗口对比?窗口匹配才算数,缺失窗口标记为「结论不可信」
experiment_replan_v0重规划预览下一步该继续、扩窗还是放弃?只给建议,不启动任务

⚖️ 提升/停止门槛:一张判定表讲清楚

最常被问到的问题是:「指标涨了,是不是就该上线?」LoopX 的答案是——还要看护栏。核心判定逻辑见 loopx/domain_packs/ml_experiment.py:

实验结果护栏状态判定结论推荐动作
主指标提升cleanpromote提升资格经 Owner/Registry 门禁后扩大窗口或交接
主指标持平任意retire_or_replan停止/重规划放弃候选,或设计机制上不同的新假设
主指标回退任意no_promote不提升停止该方向,并避免「近邻实验」盲目重试
指标待出(监控中)任意monitor继续观察轮询到同窗评估结束再下结论
护栏failedfailedblocked被护栏拦截先修护栏,再谈探索
任务失败/中止needs_repair需修复修复启动或评估路径后再重试

两个防坑设计值得注意:

  • 训练集指标只能当护栏用train_metrics_are_guardrails_only):训练曲线好看 ≠ 可以上线,结论必须在对齐的评估窗口上产生。
  • 失败要归因:失败行会带上紧凑的失败标签(如「checkpoint 缺失」「环境路径错误」),而不是把原始日志塞进状态里,避免 Agent 拿着一堆噪声重复试错。

🔒 安全默认:默认关闭,权限三级

LoopX ML Experiment 默认是off + advisory形态(见 build_ml_experiment_domain_pack_contract),能力分级如下:

自主级别能做什么不能做什么
suggest_only发现「这像个 ML 实验」并建议开启不写实验结论
advisory写紧凑结果、假设台账、重规划建议不启动/停止/重启任务、不同步生产
delivery在目标边界、配额与门禁内执行授权动作仍须显式授权 + 配额 + 预检 + 回写

所有输出都带launch_actions_enabled=falseproduction_actions_enabled=false,并且会把私有路径、凭据类内容自动脱敏为redacted:<digest>句柄——账本可以公开分享,敏感信息进不了状态。实验状态默认落盘到项目本地的.loopx/domain-state/<goal-id>/ml_experiment/ledger.jsonl(项目级、gitignore),不污染核心控制平面。

🚀 快速上手:一条 preview 命令试跑

算法同学可以零风险试用 advisory 形态——preview不写状态、不启动任何东西(完整示例见 docs/product/domain-capability-packs.md):

loopx ml-experiment preview --format json \ --experiment-id exp_preview_v1 \ --primary-metric offline_auc \ --baseline-value 0.421 --candidate-value 0.437 \ --guardrail-status clean \ --train-window train_2026w24 --eval-window eval_2026w25 \ --hypothesis-id h_route_mix_v1 \ --mechanism-family "candidate retrieval mix" --route route_mix \ --positive-evidence offline_eval_delta_positive \ --next-candidate holdout_eval

返回的四段结构正好对应本文的主线:结果判定 → 数据窗口 → 假设台账 → 重规划建议

📁 延伸阅读与源码导航

  • 能力包设计文档:docs/product/domain-capability-packs.md
  • ML 实验领域包源码:loopx/domain_packs/ml_experiment.py
  • CLI 命令注册(preview / volc-task-packet / volc-result-ledger):loopx/cli_commands/ml_experiment.py
  • 顶层兼容入口:loopx/ml_experiment.py
  • 主指标升降判定实现:classify_primary_metric_delta
  • 提升/停止结果路由实现:_volc_result_outcome

一句话总结:LoopX ML Experiment 把「假设—证据—门槛」固化为默认关闭、可审计的领域能力包,让你在长时间模型迭代中既能看清提升路径,也守得住停止线。

【免费下载链接】loopxLong-horizon agent control plane for durable, governed work across Codex, Claude Code, and other harnesses.项目地址: https://gitcode.com/GitHub_Trending/lo/loopx

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/16 14:41:06

GC3909S一芯双驱:中小功率运动控制的集成化新范式

1. 为什么这颗“一芯双驱”的GC3909S正在悄悄改变中小功率运动控制的底层逻辑你有没有遇到过这样的场景&#xff1a;给一台桌面级3D打印机加装第二路Z轴同步升降&#xff0c;结果发现主控板上那块DRV8825已经占满IO口&#xff0c;再塞一块就得改PCB&#xff1b;或者调试一台轻型…

作者头像 李华
网站建设 2026/9/16 14:39:21

小米5刷LineageOS 18.1:Android 11老旗舰刷机实践与避坑指南

简介&#xff1a;小米5安卓11最新系统lineage-18.1小米5.zip是一份为小米5机型定制的第三方系统固件&#xff0c;基于Android 11稳定分支的LineageOS 18.1&#xff0c;适合希望突破官方更新限制、自行刷入新系统以获得性能提升和个性化体验的刷机用户。压缩包共13个文件&#x…

作者头像 李华
网站建设 2026/9/16 14:38:36

TDOA/FDOA联合定位中TSWLS与ICWLS算法性能对比

1. 项目概述在无线定位技术领域&#xff0c;TDOA&#xff08;到达时间差&#xff09;和FDOA&#xff08;到达频率差&#xff09;是两种常用的被动定位方法。最近我在实际项目中遇到了一个有趣的对比场景&#xff1a;需要评估TSWLS&#xff08;Two-Stage Weighted Least Squares…

作者头像 李华