# 少量连续证书查询+精确回退:保持产出的成本比较 这一轮找到了可用的代理任务工程改进:先做均匀 16 点的连续证书检查,只对未决候选做精确连续检查,能够保持直接精确检查的全部接受结果和所选动作,并在本次重复测量中降低成本。自适应运动上界法进一步减少了精确检查数量,但没有胜过均匀 16 点方案的实测总成本。 这为后续 FM 研究提供了更便宜的候选验证工具;没有提高生成器本身的可行率,也没有训练新 attention 或证明机器人执行能力。 ## 实际完成的比较 复用上一轮已经查看过的候选库:48 个程序化场景家族、144 个场景,三个冻结模型各生成每场景 32 个候选,共 13,824 个唯一候选。没有重新生成候选或选择模型。这是开发集工程验证,不是新的独立测试集。 比较直接精确检查,以及均匀证书/运动上界证书在 8、16、32 次时间查询预算下加精确回退,共七个方案。每个模型先用前两个场景预热各方案;每轮打乱方案顺序,实际重复三次,共 63 组测量。预热、顺序、成本和全部结果均保存。 检查仍针对原始 21 结点、七球体代理的分段直线运动和静态盒体几何。均匀法一次读完整个指定网格;运动上界法从均匀八点开始,实际提前停止。连续净空下界超过 2 cm 加容差则接受,读到重叠则拒绝,否则调用精确检查。只对未决候选按场景分批计算原始线段,不从历史真值读取回退结果。域无效候选不进入几何计算。 所有方案检查完整的固定候选库,再选择已接受集合中原定代价最低的候选。真值只在调用结束后的审计中使用,没有借助真值替换所选动作。 协议在新实现和混合实验前固定,但已知上一轮结果:[协议](HYBRID_CHECKER_V1_PROTOCOL.md)、[配置](../configs/hybrid_checker_v1.json)、[冻结哈希](../artifacts/hybrid-checker-v1-freeze.json)。 ## 同样的有效产出,不同的成本 全部七个方案都接受 9,962/13,824 个有效候选(72.06%),在 375/432 次场景×模型评估中返回有效动作(86.81%),并且逐候选决策和所选索引完全一致。没有错误接受,也没有剩余未决候选;本候选库中控制域失败为零。432 是三个模型在 144 场景上的重复评估,不是独立场景数。 下表成本为三次重复的均值 [最小值, 最大值]。每次先对三个模型的批量耗时求和,再除以合计 375 次有效返回;包含最终无输出场景的成本。范围描述实测波动,不是置信区间。 | 方案 | 实际精确检查候选数/13,824 | 平均时间点查询/候选 | 新测检查与选择成本/有效返回 | 组装流水线成本/有效返回 | |---|---:|---:|---:|---:| | 直接精确检查 | 13,824(100%) | 不适用 | 38.147 [32.524, 43.692] ms | 58.603 [52.980, 64.148] ms | | 均匀 8 点+回退 | 10,091(73.00%) | 8.00 | 23.838 [23.725, 23.925] ms | 44.294 [44.181, 44.381] ms | | 均匀 16 点+回退 | 6,419(46.43%) | 16.00 | 20.136 [19.679, 20.399] ms | 40.592 [40.134, 40.855] ms | | 均匀 32 点+回退 | 3,680(26.62%) | 32.00 | 21.088 [20.640, 21.362] ms | 41.544 [41.095, 41.817] ms | | 运动上界 8 点+回退 | 10,091(73.00%) | 8.00 | 24.360 [24.278, 24.470] ms | 44.815 [44.734, 44.925] ms | | 运动上界 16 点+回退 | 4,342(31.41%) | 12.10 | 21.569 [21.419, 21.744] ms | 42.024 [41.875, 42.200] ms | | 运动上界 32 点+回退 | 2,082(15.06%) | 15.39 | 23.194 [22.991, 23.376] ms | 43.650 [43.446, 43.831] ms | “组装流水线”有明确成本口径:本轮实际测量完整检查调用,包含路径预处理、点查询、证书/优先级处理、精确回退、轨迹记录和选择;再为所有方案加上相同的、上一轮保存的条件编码、FM 积分和运动解码时间。本轮未重测生成阶段,因此不是新的一次端到端秒表测量,也不是单场景在线延迟。模型加载、文件写入和审计成本另行记录。 按上述均值计算,均匀 16 点方案的检查成本降低约 47.2%,组装流水线成本降低约 30.7%;分别配对三次重复时,后一个降幅为 30.5%、22.9%、37.4%。直接精确检查的波动明显较大,全部保留,不删除慢运行,也不把约 31% 描述成硬件或新场景上的固定加速比。本轮的比较使用本轮重新测量的精确基线,不能拿旧实验的精确耗时替换它。 完整机器可读数据:[63 组结果](../artifacts/hybrid-checker-v1/results.json)、[汇总与区间](../artifacts/hybrid-checker-v1/summary.json)、[计时顺序](../artifacts/hybrid-checker-v1/schedule.json)、[图表](../artifacts/hybrid-checker-v1/REPORT.md)、[可导出 PDF](../artifacts/hybrid-checker-v1/hybrid_results.pdf)。 ## 为什么自适应读取没有成为最快方案 均匀 16 点阶段直接认证 4,580 个候选、发现 2,825 个重叠,剩余 6,419 个才进入精确检查。其中回退接受 5,382 个、拒绝 1,037 个;4,580+5,382 恰好恢复全部 9,962 个有效候选。它没有把采样点通过当成连续安全证书。 运动上界 16 点阶段认证 6,600 个候选、发现 2,882 个重叠,只剩 4,342 个需要回退。然而三个模型合计每轮的均值成本分解为: | 方案 | 路径预处理 | 查询、证书和优先级处理 | 精确阶段 | |---|---:|---:|---:| | 均匀 16 点+回退 | 1.092 s | 2.568 s | 3.890 s | | 运动上界 16 点+回退 | 1.093 s | 4.414 s | 2.581 s | | 运动上界 32 点+回退 | 1.129 s | 6.334 s | 1.233 s | 运动上界 16 点节省的精确阶段时间约为 1.31 s,而预筛阶段多花约 1.85 s。更多查询投入继续减少了回退数量,却提高了整个调用的成本。这里比较的是这些具体实现及其资源分配;尚未分离 Python 调度、堆操作、批处理规模等因素的因果贡献。 以 48 家族为重采样单位、先平均三个冻结模型,均匀 16 点的精确回退比例为 46.43%,95% 家族 bootstrap 区间为 [39.93%, 53.07%];运动上界 16 点为 31.41% [26.19%, 37.00%]。这些是候选资源需求的区间,不是耗时区间,也不把已查看的数据变成确认性测试。 一个时间点查询仍包含七个球/盒体并集关系,而精确检查每个候选包含 140 个线段/并集关系。不同原语和批处理形状的成本不同,“减少多少次精确调用”不能替代实际总成本。 ## 验证与可复现性 独立报告程序重新计算全部原始连续净空,以直接点/AABB 算术复核查询值和区间下界;核对回退掩码、回退净空、最终决策、选择索引,以及自适应首次停止位置与上一轮完整轨迹前缀的一致性。对三次实际运行,全部保存数组均与首次相同。 验证覆盖 21 份方案×模型轨迹、96,768 次候选决策、82,944 组证书和 1,264,856 个时间点净空记录。上述次数包含不同方案对同一候选的重复检查,不增加唯一候选样本量。 75 项测试通过。新增路由测试直接监视几何调用,覆盖已获证书、已发现重叠、薄障碍漏检、正净空但不足安全距离、回退后接受/拒绝、无回退,以及控制无效且路径含 NaN 的场景。早期测试夹具把一个可认证的大净空路径误当成未决路径;修正测试几何后通过,未根据实际候选实验改变算法或阈值。代码和产物哈希见 [verification.json](../artifacts/hybrid-checker-v1/verification.json),测试输出见 [tests.txt](../artifacts/hybrid-checker-v1/tests.txt)。上游模型、候选和旧实验均保持原样。 实现:[实际混合检查](../src/motion2scene_flow/hybrid_checker.py)、[独立审计与报告](../src/motion2scene_flow/hybrid_report.py)、[回退路由测试](../tests/test_hybrid_checker.py)。复现时使用新输出目录: ```bash export PYTHONPATH=.audit-deps:src export OPENBLAS_NUM_THREADS=1 export OMP_NUM_THREADS=1 /home/linjiw/groot-wbc-sonic-sim-trackb/.venv_isaaclab/bin/python -m motion2scene_flow.hybrid_checker --config configs/hybrid_checker_v1.json --freeze artifacts/hybrid-checker-v1-freeze.json --output artifacts/new-hybrid-checker /home/linjiw/groot-wbc-sonic-sim-trackb/.venv_isaaclab/bin/python -m motion2scene_flow.hybrid_report --run artifacts/new-hybrid-checker ``` ## 对原始研究目标的下一步 把均匀 16 点+精确回退保留为当前代理实验的暂定低成本验证选项,精确检查继续作为真值与强基线。16 点是本批开发数据上的最低成本配置,不能直接宣称为一般最优预算;推广前需要冻结选择并在新场景上复验。 检查器这一阶段已回答了“能否保留有效产出并省计算”。接下来应回到生成端:全部方案仍只有 72.06% 的原始候选有效率,57/432 次场景×模型评估的候选库没有有效动作。下一项研究优先区分这些失败来自采样覆盖不足、条件表示不足,还是三个控制量的表达限制。可冻结同一解码器,比较 FM 候选与独立的域内搜索,在固定检查预算下定位可找到但 FM 未生成的有效运动;搜索失败只记为未找到,不能标为任务不可行。该诊断尚未运行,之后再决定是否训练事件监督或 motion-relative attention。 当前输入仍是完整合成几何、目标方向固定,输出仍是下蹲/转身/横移三个连续控制量。MTC 来源核验、变化导航目标、真实可用观测、原生运动解码与 SONIC 执行仍需各自的实现和证据。本轮不替代这些工作。