trannhiem/TranNhiem-Vietnamese-ImageText-Reasoning Viewer • Updated about 11 hours ago • 545k • 938 • 7
trannhiem/TranNhiem-Vietnamese-DocumentImage-Reasoning Viewer • Updated about 11 hours ago • 64.8k • 333 • 5
Runtime error Agents 72 VLM R1 Referral Expression 💬 72 Mark regions in images based on text descriptions
Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion Paper • 2412.04424 • Published Dec 5, 2024 • 63
view article Article ColFlor: Towards BERT-Size Vision-Language Document Retrieval Models ahmed-masry • Oct 18, 2024 • 22