Ruggero1912/Patch-ioner_siglip2_base_patch16_512_COCO_Captions Image-to-Text • Updated 2 days ago • 11
Ruggero1912/Patch-ioner_siglip2_base_patch16_512_COCO_Captions Image-to-Text • Updated 2 days ago • 11
MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models Paper • 2408.02718 • Published Aug 5, 2024 • 60
Maybe you are looking for CroQS: Cross-modal Query Suggestion for Text-to-Image Retrieval Paper • 2412.13834 • Published Dec 18, 2024
CountingDINO: A Training-free Pipeline for Class-Agnostic Counting using Unsupervised Backbones Paper • 2504.16570 • Published Apr 23, 2025
One Patch to Caption Them All: A Unified Zero-Shot Captioning Framework Paper • 2510.02898 • Published Oct 3, 2025 • 5 • 2