端云协同训练调度

50 Users · 20 GPU · Ceph · 5 Robots · OTA

训练中0/20
训练队列0
GPU 利用率0%
机器人0/5
OTA 队列0
Ceph 吞吐0MB/s
自动调度
方案汇报 →

操作台

自动 / 手动 · 训练 24–40s · 占用 ≈ 2×训练

提示:点击队列中的任务与空闲 GPU / 机器人卡片,再点「分配」;自动模式下空闲资源会自动接单。

整体架构

K8s · Volcano · Ceph · OTA
用户层 · 50 Users 提交训练 · 查看状态 · 触发部署 · 机器人验证 调度层 · K8s + Volcano 队列管理 · 配额 20 · 排队 · 优先级 · Gang 调度 计算层 · GPU Cluster PyTorch / TensorFlow · 20 GPU 训练槽 存储层 · Rook + Ceph CephFS 共享 · RBD · RGW 归档 · Checkpoint 部署层 · 端云协同 OTA 验证 · 打包 · OTA · 5 机器人实测

计算层 · Volcano 训练池

0 / 20 GPU

GPU 槽位 点击选中空闲槽

训练等待队列 点击选中任务

存储层 · Rook + Ceph

空闲
FS
CephFS 代码 / 数据集 / Checkpoint
0 CKPT
BD
RBD 数据库 / 日志块存储
IDLE
S3
RGW (S3) 模型归档 / 版本仓库
0 模型

部署层 · 机器人集群 OTA

0 / 5 占用
模型仓库

OTA 等待队列