Enregistré dans:
| Auteur principal: | Nortje, Leanne |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2409.02865 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Improved Visually Prompted Keyword Localisation in Real Low-Resource Settings
par: Nortje, Leanne, et autres
Publié: (2024)
par: Nortje, Leanne, et autres
Publié: (2024)
Evaluation of Audio-Visual Alignments in Visually Grounded Speech Models
par: Khorrami, Khazar, et autres
Publié: (2021)
par: Khorrami, Khazar, et autres
Publié: (2021)
Grounding Language Models for Visual Entity Recognition
par: Xiao, Zilin, et autres
Publié: (2024)
par: Xiao, Zilin, et autres
Publié: (2024)
Visually Grounded Speech Models have a Mutual Exclusivity Bias
par: Nortje, Leanne, et autres
Publié: (2024)
par: Nortje, Leanne, et autres
Publié: (2024)
VividMed: Vision Language Model with Versatile Visual Grounding for Medicine
par: Luo, Lingxiao, et autres
Publié: (2024)
par: Luo, Lingxiao, et autres
Publié: (2024)
Vision-Language Modeling in PET/CT for Visual Grounding of Positive Findings
par: Huemann, Zachary, et autres
Publié: (2025)
par: Huemann, Zachary, et autres
Publié: (2025)
Phoneme-Level Visual Speech Recognition via Point-Visual Fusion and Language Model Reconstruction
par: Teng, Matthew Kit Khinn, et autres
Publié: (2025)
par: Teng, Matthew Kit Khinn, et autres
Publié: (2025)
GroundingGPT:Language Enhanced Multi-modal Grounding Model
par: Li, Zhaowei, et autres
Publié: (2024)
par: Li, Zhaowei, et autres
Publié: (2024)
The Mechanistic Emergence of Symbol Grounding in Language Models
par: Wu, Shuyu, et autres
Publié: (2025)
par: Wu, Shuyu, et autres
Publié: (2025)
Bootstrapping Action-Grounded Visual Dynamics in Unified Vision-Language Models
par: Qiu, Yifu, et autres
Publié: (2025)
par: Qiu, Yifu, et autres
Publié: (2025)
Weakly-Supervised 3D Visual Grounding based on Visual Language Alignment
par: Xu, Xiaoxu, et autres
Publié: (2023)
par: Xu, Xiaoxu, et autres
Publié: (2023)
NAVCON: A Cognitively Inspired and Linguistically Grounded Corpus for Vision and Language Navigation
par: Wanchoo, Karan, et autres
Publié: (2024)
par: Wanchoo, Karan, et autres
Publié: (2024)
Tailored Design of Audio-Visual Speech Recognition Models using Branchformers
par: Gimeno-Gómez, David, et autres
Publié: (2024)
par: Gimeno-Gómez, David, et autres
Publié: (2024)
LLM-Optic: Unveiling the Capabilities of Large Language Models for Universal Visual Grounding
par: Zhao, Haoyu, et autres
Publié: (2024)
par: Zhao, Haoyu, et autres
Publié: (2024)
Towards Grounded Visual Spatial Reasoning in Multi-Modal Vision Language Models
par: Rajabi, Navid, et autres
Publié: (2023)
par: Rajabi, Navid, et autres
Publié: (2023)
Cognitive Visual-Language Mapper: Advancing Multimodal Comprehension with Enhanced Visual Knowledge Alignment
par: Li, Yunxin, et autres
Publié: (2024)
par: Li, Yunxin, et autres
Publié: (2024)
Generalizable Entity Grounding via Assistance of Large Language Model
par: Qi, Lu, et autres
Publié: (2024)
par: Qi, Lu, et autres
Publié: (2024)
Plug-and-Play Grounding of Reasoning in Multimodal Large Language Models
par: Chen, Jiaxing, et autres
Publié: (2024)
par: Chen, Jiaxing, et autres
Publié: (2024)
Show and Guide: Instructional-Plan Grounded Vision and Language Model
par: Glória-Silva, Diogo, et autres
Publié: (2024)
par: Glória-Silva, Diogo, et autres
Publié: (2024)
Enhancing Abnormality Grounding for Vision Language Models with Knowledge Descriptions
par: Li, Jun, et autres
Publié: (2025)
par: Li, Jun, et autres
Publié: (2025)
Evaluation and Enhancement of Semantic Grounding in Large Vision-Language Models
par: Lu, Jiaying, et autres
Publié: (2023)
par: Lu, Jiaying, et autres
Publié: (2023)
Visual Representations inside the Language Model
par: Liu, Benlin, et autres
Publié: (2025)
par: Liu, Benlin, et autres
Publié: (2025)
Adaptive Markup Language Generation for Contextually-Grounded Visual Document Understanding
par: Xiao, Han, et autres
Publié: (2025)
par: Xiao, Han, et autres
Publié: (2025)
Why are Visually-Grounded Language Models Bad at Image Classification?
par: Zhang, Yuhui, et autres
Publié: (2024)
par: Zhang, Yuhui, et autres
Publié: (2024)
Towards Visual Text Grounding of Multimodal Large Language Model
par: Li, Ming, et autres
Publié: (2025)
par: Li, Ming, et autres
Publié: (2025)
Decomposed On-Policy Distillation for Vision-Language Reasoning: Steering Gradients for Visual Grounding
par: Yoon, Hee Suk, et autres
Publié: (2026)
par: Yoon, Hee Suk, et autres
Publié: (2026)
Clean Evaluations on Contaminated Visual Language Models
par: Lu, Hongyuan, et autres
Publié: (2024)
par: Lu, Hongyuan, et autres
Publié: (2024)
Do Vision-Language Models Really Understand Visual Language?
par: Hou, Yifan, et autres
Publié: (2024)
par: Hou, Yifan, et autres
Publié: (2024)
Visually grounded few-shot word learning in low-resource settings
par: Nortje, Leanne, et autres
Publié: (2023)
par: Nortje, Leanne, et autres
Publié: (2023)
Polaris: Open-ended Interactive Robotic Manipulation via Syn2Real Visual Grounding and Large Language Models
par: Wang, Tianyu, et autres
Publié: (2024)
par: Wang, Tianyu, et autres
Publié: (2024)
SpatialViz-Bench: A Cognitively-Grounded Benchmark for Diagnosing Spatial Visualization in MLLMs
par: Wang, Siting, et autres
Publié: (2025)
par: Wang, Siting, et autres
Publié: (2025)
Efficient Temporal Extrapolation of Multimodal Large Language Models with Temporal Grounding Bridge
par: Wang, Yuxuan, et autres
Publié: (2024)
par: Wang, Yuxuan, et autres
Publié: (2024)
Does Object Grounding Really Reduce Hallucination of Large Vision-Language Models?
par: Geigle, Gregor, et autres
Publié: (2024)
par: Geigle, Gregor, et autres
Publié: (2024)
Entropy-Gradient Grounding: Training-Free Evidence Retrieval in Vision-Language Models
par: Gröpl, Marcel, et autres
Publié: (2026)
par: Gröpl, Marcel, et autres
Publié: (2026)
A Joint Study of Phrase Grounding and Task Performance in Vision and Language Models
par: Kojima, Noriyuki, et autres
Publié: (2023)
par: Kojima, Noriyuki, et autres
Publié: (2023)
MAGIC: Multimodal Alignment & Grounding-aware Instruction Coreset for Vision-Language Models
par: Biswas, Shristi Das, et autres
Publié: (2026)
par: Biswas, Shristi Das, et autres
Publié: (2026)
Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models
par: Hu, Yushi, et autres
Publié: (2024)
par: Hu, Yushi, et autres
Publié: (2024)
Groma: Localized Visual Tokenization for Grounding Multimodal Large Language Models
par: Ma, Chuofan, et autres
Publié: (2024)
par: Ma, Chuofan, et autres
Publié: (2024)
Rephrase, Augment, Reason: Visual Grounding of Questions for Vision-Language Models
par: Prasad, Archiki, et autres
Publié: (2023)
par: Prasad, Archiki, et autres
Publié: (2023)
First Logit Boosting: Visual Grounding Method to Mitigate Object Hallucination in Large Vision-Language Models
par: Ha, Jiwoo, et autres
Publié: (2026)
par: Ha, Jiwoo, et autres
Publié: (2026)
Documents similaires
-
Improved Visually Prompted Keyword Localisation in Real Low-Resource Settings
par: Nortje, Leanne, et autres
Publié: (2024) -
Evaluation of Audio-Visual Alignments in Visually Grounded Speech Models
par: Khorrami, Khazar, et autres
Publié: (2021) -
Grounding Language Models for Visual Entity Recognition
par: Xiao, Zilin, et autres
Publié: (2024) -
Visually Grounded Speech Models have a Mutual Exclusivity Bias
par: Nortje, Leanne, et autres
Publié: (2024) -
VividMed: Vision Language Model with Versatile Visual Grounding for Medicine
par: Luo, Lingxiao, et autres
Publié: (2024)