GST-Bench: Can VLMs Develop Global Spatial Awareness from Video? Paper • 2608.05747 • Published 4 days ago • 41
DreamTraj: Generating 6-DoF Object Trajectories by Reading Unrendered Video Diffusion Latents Paper • 2608.00486 • Published 9 days ago • 15
Scaling Properties of Text Conditioning in Visual Generation Paper • 2607.29679 • Published 10 days ago • 38