Video Generation Models are General-Purpose Vision Learners Paper • 2607.09024 • Published 22 days ago • 86
Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence Paper • 2607.07675 • Published 24 days ago • 64
ar0cket1/qwen3-30b-a3b-base-reasoning-sft-nemotron-math-v4-cot4k12k-500m-supervised Updated 6 days ago • 343 • 1
Imaginative Perception Tokens Enhance Spatial Reasoning in Multimodal Language Models Paper • 2606.03988 • Published Jun 3 • 126