Describe anything model for visual question answering on text-rich images
ICCV 2025 - VisionDocs
Cite this work
Yen-Linh Vu, Dinh-Thang Duong, Truong-Binh Duong, Anh-Khoi Nguyen, Thanh-Huy Nguyen, Le Thien Phuc Nguyen, Jianhua Xing, Xingjian Li, Tianyang Wang, Ulas Bagci, Min Xu (2025). Describe anything model for visual question answering on text-rich images. ICCV 2025 - VisionDocs
BibTeX