Enregistré dans:
| Auteurs principaux: | Panagos, Iason Ioannis, Sfikas, Giorgos, Nikou, Christophoros |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2502.04834 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Designing Practical Models for Isolated Word Visual Speech Recognition
par: Panagos, Iason Ioannis, et autres
Publié: (2025)
par: Panagos, Iason Ioannis, et autres
Publié: (2025)
Best Practices for a Handwritten Text Recognition System
par: Retsinas, George, et autres
Publié: (2024)
par: Retsinas, George, et autres
Publié: (2024)
Optimal Transport for Handwritten Text Recognition in a Low-Resource Regime
par: Wraight, Petros Georgoulas, et autres
Publié: (2025)
par: Wraight, Petros Georgoulas, et autres
Publié: (2025)
Developing Lightweight DNN Models With Limited Data For Real-Time Sign Language Recognition
par: Nikitin, Nikita, et autres
Publié: (2025)
par: Nikitin, Nikita, et autres
Publié: (2025)
ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning
par: Kim, Taewhan, et autres
Publié: (2024)
par: Kim, Taewhan, et autres
Publié: (2024)
A Survey of Automatic Evaluation Methods on Text, Visual and Speech Generations
par: Lan, Tian, et autres
Publié: (2025)
par: Lan, Tian, et autres
Publié: (2025)
The LLM Bottleneck: Why Open-Source Vision LLMs Struggle with Hierarchical Visual Recognition
par: Tan, Yuwen, et autres
Publié: (2025)
par: Tan, Yuwen, et autres
Publié: (2025)
Analyzing and Boosting the Power of Fine-Grained Visual Recognition for Multi-modal Large Language Models
par: He, Hulingxiao, et autres
Publié: (2025)
par: He, Hulingxiao, et autres
Publié: (2025)
VLSM-Adapter: Finetuning Vision-Language Segmentation Efficiently with Lightweight Blocks
par: Dhakal, Manish, et autres
Publié: (2024)
par: Dhakal, Manish, et autres
Publié: (2024)
CatLIP: CLIP-level Visual Recognition Accuracy with 2.7x Faster Pre-training on Web-scale Image-Text Data
par: Mehta, Sachin, et autres
Publié: (2024)
par: Mehta, Sachin, et autres
Publié: (2024)
OLKAVS: An Open Large-Scale Korean Audio-Visual Speech Dataset
par: Park, Jeongkyun, et autres
Publié: (2023)
par: Park, Jeongkyun, et autres
Publié: (2023)
JSTR: Judgment Improves Scene Text Recognition
par: Fujitake, Masato
Publié: (2024)
par: Fujitake, Masato
Publié: (2024)
Rethinking Genomic Modeling Through Optical Character Recognition
par: Xiang, Hongxin, et autres
Publié: (2026)
par: Xiang, Hongxin, et autres
Publié: (2026)
Vision Language Models for Dynamic Human Activity Recognition in Healthcare Settings
par: Abid, Abderrazek, et autres
Publié: (2025)
par: Abid, Abderrazek, et autres
Publié: (2025)
Analyzing The Language of Visual Tokens
par: Chan, David M., et autres
Publié: (2024)
par: Chan, David M., et autres
Publié: (2024)
Reconstructive Visual Instruction Tuning
par: Wang, Haochen, et autres
Publié: (2024)
par: Wang, Haochen, et autres
Publié: (2024)
Learning to Instruct for Visual Instruction Tuning
par: Zhou, Zhihan, et autres
Publié: (2025)
par: Zhou, Zhihan, et autres
Publié: (2025)
Universal Approximation of Visual Autoregressive Transformers
par: Chen, Yifang, et autres
Publié: (2025)
par: Chen, Yifang, et autres
Publié: (2025)
Improved Baselines with Visual Instruction Tuning
par: Liu, Haotian, et autres
Publié: (2023)
par: Liu, Haotian, et autres
Publié: (2023)
Self-Supervised Visual Preference Alignment
par: Zhu, Ke, et autres
Publié: (2024)
par: Zhu, Ke, et autres
Publié: (2024)
Parrot: Multilingual Visual Instruction Tuning
par: Sun, Hai-Long, et autres
Publié: (2024)
par: Sun, Hai-Long, et autres
Publié: (2024)
Visual Text Matters: Improving Text-KVQA with Visual Text Entity Knowledge-aware Large Multimodal Assistant
par: Penamakuri, Abhirama Subramanyam, et autres
Publié: (2024)
par: Penamakuri, Abhirama Subramanyam, et autres
Publié: (2024)
Zero-Shot Vehicle Model Recognition via Text-Based Retrieval-Augmented Generation
par: Chang, Wei-Chia, et autres
Publié: (2025)
par: Chang, Wei-Chia, et autres
Publié: (2025)
Can Visual Encoder Learn to See Arrows?
par: Terashita, Naoyuki, et autres
Publié: (2025)
par: Terashita, Naoyuki, et autres
Publié: (2025)
Visual Planning: Let's Think Only with Images
par: Xu, Yi, et autres
Publié: (2025)
par: Xu, Yi, et autres
Publié: (2025)
Exploring Diverse Methods in Visual Question Answering
par: Li, Panfeng, et autres
Publié: (2024)
par: Li, Panfeng, et autres
Publié: (2024)
MLLMs-Augmented Visual-Language Representation Learning
par: Liu, Yanqing, et autres
Publié: (2023)
par: Liu, Yanqing, et autres
Publié: (2023)
What's Holding Back Latent Visual Reasoning?
par: Viveiros, André G., et autres
Publié: (2026)
par: Viveiros, André G., et autres
Publié: (2026)
VIST-GPT: Ushering in the Era of Visual Storytelling with LLMs?
par: Gado, Mohamed, et autres
Publié: (2025)
par: Gado, Mohamed, et autres
Publié: (2025)
PerceptionCLIP: Visual Classification by Inferring and Conditioning on Contexts
par: An, Bang, et autres
Publié: (2023)
par: An, Bang, et autres
Publié: (2023)
Visual Question Decomposition on Multimodal Large Language Models
par: Zhang, Haowei, et autres
Publié: (2024)
par: Zhang, Haowei, et autres
Publié: (2024)
Unified Lexical Representation for Interpretable Visual-Language Alignment
par: Li, Yifan, et autres
Publié: (2024)
par: Li, Yifan, et autres
Publié: (2024)
Towards Visual Text Grounding of Multimodal Large Language Model
par: Li, Ming, et autres
Publié: (2025)
par: Li, Ming, et autres
Publié: (2025)
VisAidMath: Benchmarking Visual-Aided Mathematical Reasoning
par: Ma, Jingkun, et autres
Publié: (2024)
par: Ma, Jingkun, et autres
Publié: (2024)
CVQA: Culturally-diverse Multilingual Visual Question Answering Benchmark
par: Romero, David, et autres
Publié: (2024)
par: Romero, David, et autres
Publié: (2024)
MouSi: Poly-Visual-Expert Vision-Language Models
par: Fan, Xiaoran, et autres
Publié: (2024)
par: Fan, Xiaoran, et autres
Publié: (2024)
Frozen Transformers in Language Models Are Effective Visual Encoder Layers
par: Pang, Ziqi, et autres
Publié: (2023)
par: Pang, Ziqi, et autres
Publié: (2023)
Why are Visually-Grounded Language Models Bad at Image Classification?
par: Zhang, Yuhui, et autres
Publié: (2024)
par: Zhang, Yuhui, et autres
Publié: (2024)
Picturing Ambiguity: A Visual Twist on the Winograd Schema Challenge
par: Park, Brendan, et autres
Publié: (2024)
par: Park, Brendan, et autres
Publié: (2024)
Find The Gap: Knowledge Base Reasoning For Visual Question Answering
par: Barezi, Elham J., et autres
Publié: (2024)
par: Barezi, Elham J., et autres
Publié: (2024)
Documents similaires
-
Designing Practical Models for Isolated Word Visual Speech Recognition
par: Panagos, Iason Ioannis, et autres
Publié: (2025) -
Best Practices for a Handwritten Text Recognition System
par: Retsinas, George, et autres
Publié: (2024) -
Optimal Transport for Handwritten Text Recognition in a Low-Resource Regime
par: Wraight, Petros Georgoulas, et autres
Publié: (2025) -
Developing Lightweight DNN Models With Limited Data For Real-Time Sign Language Recognition
par: Nikitin, Nikita, et autres
Publié: (2025) -
ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning
par: Kim, Taewhan, et autres
Publié: (2024)