Minimize idle accelerators: Native RL job interleaving with co-operative time-slicing in llm-d
The llm-d project introduces co-operative time-slicing to interleave independent reinforcement learning jobs on shared hardware, increasing aggregate accelerator duty cycles from ~40% to 70% without i…