By My Eyes: Grounding Multimodal Large Language Models with Sensor Data via Visual Prompting
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yoon, Hyungjun, Tolera, Biniyam Aschalew, Gong, Taesik, Lee, Kimin, Lee, Sung-Ju |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SelfReplay: Adapting Self-Supervised Sensory Models via Adaptive Meta-Task Replay
par: Yoon, Hyungjun, et autres
Publié: (2024)
par: Yoon, Hyungjun, et autres
Publié: (2024)
Evaluating Visual Prompts with Eye-Tracking Data for MLLM-Based Human Activity Recognition
par: Choi, Jae Young, et autres
Publié: (2026)
par: Choi, Jae Young, et autres
Publié: (2026)
AETTA: Label-Free Accuracy Estimation for Test-Time Adaptation
par: Lee, Taeckyung, et autres
Publié: (2024)
par: Lee, Taeckyung, et autres
Publié: (2024)
v1: Learning to Point Visual Tokens for Multimodal Grounded Reasoning
par: Chung, Jiwan, et autres
Publié: (2025)
par: Chung, Jiwan, et autres
Publié: (2025)
Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles
par: Slyman, Eric, et autres
Publié: (2025)
par: Slyman, Eric, et autres
Publié: (2025)
Towards Visual Text Grounding of Multimodal Large Language Model
par: Li, Ming, et autres
Publié: (2025)
par: Li, Ming, et autres
Publié: (2025)
Grounding Language Models for Visual Entity Recognition
par: Xiao, Zilin, et autres
Publié: (2024)
par: Xiao, Zilin, et autres
Publié: (2024)
Image-of-Thought Prompting for Visual Reasoning Refinement in Multimodal Large Language Models
par: Zhou, Qiji, et autres
Publié: (2024)
par: Zhou, Qiji, et autres
Publié: (2024)
Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues
par: Kim, Youngmin, et autres
Publié: (2025)
par: Kim, Youngmin, et autres
Publié: (2025)
Decomposed On-Policy Distillation for Vision-Language Reasoning: Steering Gradients for Visual Grounding
par: Yoon, Hee Suk, et autres
Publié: (2026)
par: Yoon, Hee Suk, et autres
Publié: (2026)
Groma: Localized Visual Tokenization for Grounding Multimodal Large Language Models
par: Ma, Chuofan, et autres
Publié: (2024)
par: Ma, Chuofan, et autres
Publié: (2024)
Plug-and-Play Grounding of Reasoning in Multimodal Large Language Models
par: Chen, Jiaxing, et autres
Publié: (2024)
par: Chen, Jiaxing, et autres
Publié: (2024)
Rethinking Visual Prompting for Multimodal Large Language Models with External Knowledge
par: Lin, Yuanze, et autres
Publié: (2024)
par: Lin, Yuanze, et autres
Publié: (2024)
How Multimodal LLMs Solve Image Tasks: A Lens on Visual Grounding, Task Reasoning, and Answer Decoding
par: Yu, Zhuoran, et autres
Publié: (2025)
par: Yu, Zhuoran, et autres
Publié: (2025)
Black-Box Visual Prompt Engineering for Mitigating Object Hallucination in Large Vision Language Models
par: Woo, Sangmin, et autres
Publié: (2025)
par: Woo, Sangmin, et autres
Publié: (2025)
ViP-LLaVA: Making Large Multimodal Models Understand Arbitrary Visual Prompts
par: Cai, Mu, et autres
Publié: (2023)
par: Cai, Mu, et autres
Publié: (2023)
Efficient Temporal Extrapolation of Multimodal Large Language Models with Temporal Grounding Bridge
par: Wang, Yuxuan, et autres
Publié: (2024)
par: Wang, Yuxuan, et autres
Publié: (2024)
MOTOR: Multimodal Optimal Transport via Grounded Retrieval in Medical Visual Question Answering
par: Shaaban, Mai A., et autres
Publié: (2025)
par: Shaaban, Mai A., et autres
Publié: (2025)
Do Multimodal Large Language Models Understand Welding?
par: Khvatskii, Grigorii, et autres
Publié: (2025)
par: Khvatskii, Grigorii, et autres
Publié: (2025)
ExpVG: Investigating the Design Space of Visual Grounding in Multimodal Large Language Model
par: Kang, Weitai, et autres
Publié: (2025)
par: Kang, Weitai, et autres
Publié: (2025)
Large Language Models can Share Images, Too!
par: Lee, Young-Jun, et autres
Publié: (2023)
par: Lee, Young-Jun, et autres
Publié: (2023)
ChatEXAONEPath: An Expert-level Multimodal Large Language Model for Histopathology Using Whole Slide Images
par: Kim, Sangwook, et autres
Publié: (2025)
par: Kim, Sangwook, et autres
Publié: (2025)
VLind-Bench: Measuring Language Priors in Large Vision-Language Models
par: Lee, Kang-il, et autres
Publié: (2024)
par: Lee, Kang-il, et autres
Publié: (2024)
Grounding Partially-Defined Events in Multimodal Data
par: Sanders, Kate, et autres
Publié: (2024)
par: Sanders, Kate, et autres
Publié: (2024)
VP-MEL: Visual Prompts Guided Multimodal Entity Linking
par: Mi, Hongze, et autres
Publié: (2024)
par: Mi, Hongze, et autres
Publié: (2024)
WorldMM: Dynamic Multimodal Memory Agent for Long Video Reasoning
par: Yeo, Woongyeong, et autres
Publié: (2025)
par: Yeo, Woongyeong, et autres
Publié: (2025)
Generalizable Entity Grounding via Assistance of Large Language Model
par: Qi, Lu, et autres
Publié: (2024)
par: Qi, Lu, et autres
Publié: (2024)
Task-Aware Resolution Optimization for Visual Large Language Models
par: Luo, Weiqing, et autres
Publié: (2025)
par: Luo, Weiqing, et autres
Publié: (2025)
Identity Decoupling for Multi-Subject Personalization of Text-to-Image Models
par: Jang, Sangwon, et autres
Publié: (2024)
par: Jang, Sangwon, et autres
Publié: (2024)
ScratchEval: Are GPT-4o Smarter than My Child? Evaluating Large Multimodal Models with Visual Programming Challenges
par: Fu, Rao, et autres
Publié: (2024)
par: Fu, Rao, et autres
Publié: (2024)
MoDES: Accelerating Mixture-of-Experts Multimodal Large Language Models via Dynamic Expert Skipping
par: Huang, Yushi, et autres
Publié: (2025)
par: Huang, Yushi, et autres
Publié: (2025)
CODIS: Benchmarking Context-Dependent Visual Comprehension for Multimodal Large Language Models
par: Luo, Fuwen, et autres
Publié: (2024)
par: Luo, Fuwen, et autres
Publié: (2024)
Pinpointing Trigger Moment for Grounded Video QA: Enhancing Spatio-temporal Grounding in Multimodal Large Language Models
par: Seo, Jinhwan, et autres
Publié: (2025)
par: Seo, Jinhwan, et autres
Publié: (2025)
Exploring Multimodal Perception in Large Language Models Through Perceptual Strength Ratings
par: Lee, Jonghyun, et autres
Publié: (2025)
par: Lee, Jonghyun, et autres
Publié: (2025)
SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning
par: Huang, Haoyu, et autres
Publié: (2026)
par: Huang, Haoyu, et autres
Publié: (2026)
Polaris: Open-ended Interactive Robotic Manipulation via Syn2Real Visual Grounding and Large Language Models
par: Wang, Tianyu, et autres
Publié: (2024)
par: Wang, Tianyu, et autres
Publié: (2024)
MemEye: A Visual-Centric Evaluation Framework for Multimodal Agent Memory
par: Guo, Minghao, et autres
Publié: (2026)
par: Guo, Minghao, et autres
Publié: (2026)
Look & Mark: Leveraging Radiologist Eye Fixations and Bounding boxes in Multimodal Large Language Models for Chest X-ray Report Generation
par: Kim, Yunsoo, et autres
Publié: (2025)
par: Kim, Yunsoo, et autres
Publié: (2025)
Pre-Training Multimodal Hallucination Detectors with Corrupted Grounding Data
par: Whitehead, Spencer, et autres
Publié: (2024)
par: Whitehead, Spencer, et autres
Publié: (2024)
CREMA: Generalizable and Efficient Video-Language Reasoning via Multimodal Modular Fusion
par: Yu, Shoubin, et autres
Publié: (2024)
par: Yu, Shoubin, et autres
Publié: (2024)
Documents similaires
-
SelfReplay: Adapting Self-Supervised Sensory Models via Adaptive Meta-Task Replay
par: Yoon, Hyungjun, et autres
Publié: (2024) -
Evaluating Visual Prompts with Eye-Tracking Data for MLLM-Based Human Activity Recognition
par: Choi, Jae Young, et autres
Publié: (2026) -
AETTA: Label-Free Accuracy Estimation for Test-Time Adaptation
par: Lee, Taeckyung, et autres
Publié: (2024) -
v1: Learning to Point Visual Tokens for Multimodal Grounded Reasoning
par: Chung, Jiwan, et autres
Publié: (2025) -
Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles
par: Slyman, Eric, et autres
Publié: (2025)