资源争用
50 人共享有限 GPU 与 5 台机器人,需要配额、排队与优先级,避免死锁与空转。
TECHNICAL BRIEFING
50 人共享有限 GPU 与 5 台机器人,需要配额、排队与优先级,避免死锁与空转。
代码、数据集、Checkpoint、模型权重需多节点共享读写,训练中断可恢复。
云端训练小脑模型 → 验证入库 → OTA 到指定机器人 → 用户实测 → 再迭代。
CNCF 批处理调度,专为 AI 训练设计。队列能力上限 20 GPU;超限自动排队,释放后续跑;支持优先级插队与 Gang 调度,避免分布式训练死锁。
通过 CSI 将 Ceph 暴露为 Kubernetes 存储类,训练 Pod 挂载共享卷。
云端大脑(大模型规划)+ 端侧小脑(高频控制)。训练完成 → 自动验证 → 注册模型仓库 → OTA 推送 → 灰度到机器人。
演示引擎用 requestAnimationFrame 驱动状态机;支持 0.5× / 1× / 2× / 5× 时钟。自动模式下空闲资源自动接单;手动模式下完全由操作台分配。
| 模块 | 技术选型 | 核心价值 |
|---|---|---|
| 资源调度 | Kubernetes + Volcano | 20 并发配额,超限排队,GPU 利用率提升 |
| 模型存储 | Rook + Ceph | 统一共享,Checkpoint 恢复,PB 级扩展 |
| 端云协同 | 云端大模型 + 端侧小脑 | 复杂推理上云,实时控制在端 |
| 模型部署 | CI/CD + OTA | 验证 → 入库 → 推送 → 实测 |
| 机器人调度 | 队列 + 标签选择 | 5 台合理分配,避免冲突 |
状态机:queued → training → validating → model_ready → ota_queued → ota → verifying → done