
机械臂的仿射学习在无相机标定条件即不知道内外参、但运算资源充足的前提下可以放弃依赖精确3D重投影的方案转而采用纯视觉、自监督、集合感知的端到端学习框架。目标仍是从多视角视频直接预测新机械臂的关节轨迹且不依赖旧臂真值关节角。针对该约束优化后的完整可行方案融合了单签先进的自监督3D表示学习 多视角一致性 运动学解耦技术。核心思想隐式3D结构学习 跨视角运动学对齐 运动解码不显式重建3D姿态而是让网络 隐式学习与视角无关的机械臂运动表征并通过多视角一致性约束 和 URDF 先验引导其物理合理性。✅ 核心思想隐式 3D 结构学习 跨视角运动对齐 动作解码不显式重建 3D 姿态而是让网络 隐式学习与视角无关的机械臂运动表征并通过 多视角一致性约束 和 URDF 先验 引导其物理合理性。一、整体架构URDF-Guided Multi-View Video Transformer (URDF-MVVT)整个模型是 单一可训练网络满足“端到端”要求。二、关键创新模块解决无标定问题▶ 1. 多视角特征对齐 via Contrastive Geometry Learning由于无标定无法做 3D 投影但我们可以利用同一时刻不同视角看到的是 同一物理状态机械臂运动具有 时间连续性方法跨视角对比学习Cross-View Contrastive Loss对每个时间步 t从各视角提取全局特征 ft(k)正样本同一 t 的不同视角 {ft(1),ft(2),…}负样本其他时间步的任意视角使用 InfoNCE loss 拉近正样本、推开负样本✅ 效果迫使网络学习 视角不变的运动状态表征▶ 2. 引入 URDF 作为结构先验非监督但可微虽然不能做 FK/IK因无 3D 姿态但可将 URDF 编码为 运动学约束损失。方法可微分运动学正则化Differentiable Kinematic Regularization假设网络输出的旧臂隐式姿态为 ϕt∈Rd中间表示构造一个 可微分 FK 模块基于 URDFFKold(ϕt)→3D keypoints虽然不知道真实 3D但可要求连杆长度恒定相邻关节点距离应等于 URDF 中定义的连杆长度关节运动范围合理ϕt 应在物理限位内soft penalty✅ 即使没有 3D 真值也能通过 结构守恒 约束隐空间▶ 3. 从旧臂隐式表征 → 新臂关节可学习运动学映射由于新旧臂结构不同不能直接复制动作。我们训练一个 可学习的运动学适配器Kinematic Adapter输入旧臂隐式状态序列 {ϕt}输出新臂关节 θtnew约束末端轨迹一致性隐式用新臂 FK 计算 EE要求其变化平滑任务语义对齐使用 DTW动态时间规整 或 OT最优传输 对齐旧臂动作阶段与新臂动作阶段更高级用 Diffusion Policy 生成多模态合理新臂轨迹▶ 4. 自监督时序建模未来帧预测作为辅助任务为增强时序理解加入 视频未来帧重建 辅助损失冻结 ViT 编码器用 decoder 从 {ϕ1:t} 预测下一帧图像任一视角使用 LPIPS SSIM L1 损失✅ 提升模型对运动动力学的理解减少抖动三、训练策略充分利用算力1. 两阶段训练阶段目标方法Stage 1学习视角不变运动表征对比学习 视频重建 运动学正则Stage 2学习新臂动作映射固定编码器训练 Kinematic Adapter 输出头2. 大规模数据增强利用算力时空裁剪随机时间窗口 随机空间 crop跨视角一致视角模拟用 NeRF 或 Gaussian Splatting 合成新视角即使无标定可用 COLMAP 估计稀疏点云做粗略新视图合成光照/遮挡增强RandAugment CutOut3. 模型规模使用 ViT-Large/16 或 VideoMAE-Huge 作为 backbone时间建模Timesformer-Large 或 InternVideo2batch size ≥ 32多卡训练四、推理与部署输入实时多视角视频流同步滑动窗口如最近 32 帧送入模型输出新臂关节指令可加后处理平滑延迟优化用 TensorRT 编译模型或蒸馏到小型 CNNTransformer 混合模型五、评估方式无真值下的替代指标指标说明任务成功率仿真在 PyBullet 中加载新臂 URDF执行预测轨迹看是否完成抓取/焊接运动平滑度jerk, acceleration norm跨视角一致性不同视角输入 → 输出轨迹的 RMSEURDF 合规性关节越界次数、连杆长度偏差人类评分工程师对动作自然度打分0–5六、为什么此方案可行挑战解决方案无标定用对比学习替代几何投影无旧臂真值用 URDF 结构先验 自监督正则新旧臂差异可学习 Kinematic Adapter端到端要求单一网络联合优化七、推荐开源工具支持无标定COLMAP从多视角视频估计稀疏 3D 点云用于新视图合成3DGS (3D Gaussian Splatting)快速新视角合成即使无标定可用自动初始化timm / HuggingFace VideoMAE预训练 ViT backbonePyBullet仿真验证Diffusion Policy生成鲁棒动作https://diffusion-policy.cs.columbia.edu/八、 总结在 无标定、无旧臂真值 条件下可行的端到端 ViT 方案必须放弃显式 3D 重建转向 隐式几何学习利用 URDF 作为软约束而非硬映射通过多视角一致性 替代相机标定用大规模自监督预训练 弥补标注缺失最终模型一个大型多视角视频 Transformer内置 URDF 先验和可学习运动学适配器输出新机械臂控制指令。