04:00
2026-09-02
arxiv.org
artificial-intelligence
ViTAL-X: Video-Text Alignment with Cross-Modal Temporal Edits
Researchers introduced ViTAL-X, a lightweight 0.4B-parameter model that achieves state-of-the-art performance on six temporal benchmarks, outperforming 7B-parameter models and baselines trained on 600…