Multitask DiT

Toyota Research Institute

LeRobot Multitask DiT

LeRobot Multitask DiT

CLIP-conditioned diffusion transformer policy for learning multiple tasks.

Specifications

Architecture components
Diffusion action decoder
Backbone
CLIP vision-language embeddings with diffusion transformer
Frameworks
LeRobot / PyTorch
Input modalities
Language instruction
Input modalities
RGB camera images
Input modalities
Robot state / proprioception
Model type
Robot policy
Output action space
Continuous multitask robot action chunks
Parameter count
0.45B parameters
Pipeline task
Robotics

Lineage

Unknown

Architecture & I/O

trajectory · continuous

Unknown

Continuous multitask robot action chunks

No published default checkpoint.

Resources

Submit info