MultihopSpatial: Multi-hop Compositional Spatial Reasoning Benchmark for Vision-Language Model
-
etri-vilab/MultihopSpatial
Viewer ⢠Updated ⢠15.8k ⢠755 ⢠4 -
etri-vilab/MultiHopSpatial-Qwen3-VL-4B-Instruct
Image-Text-to-Text ⢠4B ⢠Updated ⢠97 ⢠2 -
etri-vilab/MultiHopSpatial-Qwen3-VL-8B-Instruct
Image-Text-to-Text ⢠9B ⢠Updated ⢠48 ⢠1 -
etri-vilab/MultiHopSpatial-Qwen3-VL-32B-Instruct
Image-Text-to-Text ⢠33B ⢠Updated ⢠40 ⢠1