GEM: Context-Aware Gaze EstiMation with Visual Search Behavior Matching for Chest Radiograph
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Shaonan, Chen, Wenting, Liu, Jie, Luo, Xiaoling, Shen, Linlin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Benchmarking Egocentric Clinical Intent Understanding Capability for Medical Multimodal Large Language Models
di: Liu, Shaonan, et al.
Pubblicazione: (2026)
di: Liu, Shaonan, et al.
Pubblicazione: (2026)
DAMPER: A Dual-Stage Medical Report Generation Framework with Coarse-Grained MeSH Alignment and Fine-Grained Hypergraph Matching
di: Huang, Xiaofei, et al.
Pubblicazione: (2024)
di: Huang, Xiaofei, et al.
Pubblicazione: (2024)
SurvAgent: Hierarchical CoT-Enhanced Case Banking and Dichotomy-Based Multi-Agent System for Multimodal Survival Prediction
di: Huang, Guolin, et al.
Pubblicazione: (2025)
di: Huang, Guolin, et al.
Pubblicazione: (2025)
Fine-Grained Image-Text Alignment in Medical Imaging Enables Explainable Cyclic Image-Report Generation
di: Chen, Wenting, et al.
Pubblicazione: (2023)
di: Chen, Wenting, et al.
Pubblicazione: (2023)
A Spectrum Evaluation Benchmark for Medical Multi-Modal Large Language Models
di: Liu, Jie, et al.
Pubblicazione: (2024)
di: Liu, Jie, et al.
Pubblicazione: (2024)
Grounding Chest X-Ray Visual Question Answering with Generated Radiology Reports
di: Serra, Francesco Dalla, et al.
Pubblicazione: (2025)
di: Serra, Francesco Dalla, et al.
Pubblicazione: (2025)
Enhancing Human-Computer Interaction in Chest X-ray Analysis using Vision and Language Model with Eye Gaze Patterns
di: Kim, Yunsoo, et al.
Pubblicazione: (2024)
di: Kim, Yunsoo, et al.
Pubblicazione: (2024)
Visual In-Context Learning for Large Vision-Language Models
di: Zhou, Yucheng, et al.
Pubblicazione: (2024)
di: Zhou, Yucheng, et al.
Pubblicazione: (2024)
V-ABS: Action-Observer Driven Beam Search for Dynamic Visual Reasoning
di: Ning, Zhiwei, et al.
Pubblicazione: (2026)
di: Ning, Zhiwei, et al.
Pubblicazione: (2026)
A Gaze-grounded Visual Question Answering Dataset for Clarifying Ambiguous Japanese Questions
di: Inadumi, Shun, et al.
Pubblicazione: (2024)
di: Inadumi, Shun, et al.
Pubblicazione: (2024)
Pretraining Vision-Language Model for Difference Visual Question Answering in Longitudinal Chest X-rays
di: Cho, Yeongjae, et al.
Pubblicazione: (2024)
di: Cho, Yeongjae, et al.
Pubblicazione: (2024)
VQA-MHUG: A Gaze Dataset to Study Multimodal Neural Attention in Visual Question Answering
di: Sood, Ekta, et al.
Pubblicazione: (2021)
di: Sood, Ekta, et al.
Pubblicazione: (2021)
Culture-Aware Humorous Captioning: Multimodal Humor Generation across Cultural Contexts
di: Xu, Run, et al.
Pubblicazione: (2026)
di: Xu, Run, et al.
Pubblicazione: (2026)
Rethinking Visual Dependency in Long-Context Reasoning for Large Vision-Language Models
di: Zhou, Yucheng, et al.
Pubblicazione: (2024)
di: Zhou, Yucheng, et al.
Pubblicazione: (2024)
Embodied-Reasoner: Synergizing Visual Search, Reasoning, and Action for Embodied Interactive Tasks
di: Zhang, Wenqi, et al.
Pubblicazione: (2025)
di: Zhang, Wenqi, et al.
Pubblicazione: (2025)
VICCA: Visual Interpretation and Comprehension of Chest X-ray Anomalies in Generated Report Without Human Feedback
di: Picha, Sayeh Gholipour, et al.
Pubblicazione: (2025)
di: Picha, Sayeh Gholipour, et al.
Pubblicazione: (2025)
MMedExpert-R1: Strengthening Multimodal Medical Reasoning via Domain-Specific Adaptation and Clinical Guideline Reinforcement
di: Ding, Meidan, et al.
Pubblicazione: (2026)
di: Ding, Meidan, et al.
Pubblicazione: (2026)
Make LVLMs Focus: Context-Aware Attention Modulation for Better Multimodal In-Context Learning
di: Li, Yanshu, et al.
Pubblicazione: (2025)
di: Li, Yanshu, et al.
Pubblicazione: (2025)
CODIS: Benchmarking Context-Dependent Visual Comprehension for Multimodal Large Language Models
di: Luo, Fuwen, et al.
Pubblicazione: (2024)
di: Luo, Fuwen, et al.
Pubblicazione: (2024)
Beyond the Leaderboard: Rethinking Medical Benchmarks for Large Language Models
di: Chen, Wenting, et al.
Pubblicazione: (2025)
di: Chen, Wenting, et al.
Pubblicazione: (2025)
HySurvPred: Multimodal Hyperbolic Embedding with Angle-Aware Hierarchical Contrastive Learning and Uncertainty Constraints for Survival Prediction
di: Yang, Jiaqi, et al.
Pubblicazione: (2025)
di: Yang, Jiaqi, et al.
Pubblicazione: (2025)
Glyph: Scaling Context Windows via Visual-Text Compression
di: Cheng, Jiale, et al.
Pubblicazione: (2025)
di: Cheng, Jiale, et al.
Pubblicazione: (2025)
Task-Aware Resolution Optimization for Visual Large Language Models
di: Luo, Weiqing, et al.
Pubblicazione: (2025)
di: Luo, Weiqing, et al.
Pubblicazione: (2025)
Medical Reasoning in the Era of LLMs: A Systematic Review of Enhancement Techniques and Applications
di: Wang, Wenxuan, et al.
Pubblicazione: (2025)
di: Wang, Wenxuan, et al.
Pubblicazione: (2025)
OMCAT: Omni Context Aware Transformer
di: Goel, Arushi, et al.
Pubblicazione: (2024)
di: Goel, Arushi, et al.
Pubblicazione: (2024)
WSI-LLaVA: A Multimodal Large Language Model for Whole Slide Image
di: Liang, Yuci, et al.
Pubblicazione: (2024)
di: Liang, Yuci, et al.
Pubblicazione: (2024)
Vision-Language Models Mistake Head Orientation for Gaze Direction: Nonverbal Conversation Cues
di: Zhang, Zory, et al.
Pubblicazione: (2025)
di: Zhang, Zory, et al.
Pubblicazione: (2025)
Seeing Like Radiologists: Context- and Gaze-Guided Vision-Language Pretraining for Chest X-rays
di: Liu, Kang, et al.
Pubblicazione: (2026)
di: Liu, Kang, et al.
Pubblicazione: (2026)
Context-aware Visual Storytelling with Visual Prefix Tuning and Contrastive Learning
di: Song, Yingjin, et al.
Pubblicazione: (2024)
di: Song, Yingjin, et al.
Pubblicazione: (2024)
Rethinking Visual Attribution for Chest X-ray Reasoning in Large Vision Language Models
di: Xiong, Guangzhi, et al.
Pubblicazione: (2026)
di: Xiong, Guangzhi, et al.
Pubblicazione: (2026)
Visual Confused Deputy: Exploiting and Defending Perception Failures in Computer-Using Agents
di: Liu, Xunzhuo, et al.
Pubblicazione: (2026)
di: Liu, Xunzhuo, et al.
Pubblicazione: (2026)
VAGUE: Visual Contexts Clarify Ambiguous Expressions
di: Nam, Heejeong, et al.
Pubblicazione: (2024)
di: Nam, Heejeong, et al.
Pubblicazione: (2024)
AOR: Anatomical Ontology-Guided Reasoning for Medical Large Multimodal Model in Chest X-Ray Interpretation
di: Li, Qingqiu, et al.
Pubblicazione: (2025)
di: Li, Qingqiu, et al.
Pubblicazione: (2025)
Lamps: Learning Anatomy from Multiple Perspectives via Self-supervision in Chest Radiographs
di: Zhou, Ziyu, et al.
Pubblicazione: (2025)
di: Zhou, Ziyu, et al.
Pubblicazione: (2025)
GazeCLIP: Gaze-Guided CLIP with Adaptive-Enhanced Fine-Grained Language Prompt for Deepfake Attribution and Detection
di: Zhang, Yaning, et al.
Pubblicazione: (2026)
di: Zhang, Yaning, et al.
Pubblicazione: (2026)
StreamGaze: Gaze-Guided Temporal Reasoning and Proactive Understanding in Streaming Videos
di: Lee, Daeun, et al.
Pubblicazione: (2025)
di: Lee, Daeun, et al.
Pubblicazione: (2025)
LongVILA: Scaling Long-Context Visual Language Models for Long Videos
di: Chen, Yukang, et al.
Pubblicazione: (2024)
di: Chen, Yukang, et al.
Pubblicazione: (2024)
Look & Mark: Leveraging Radiologist Eye Fixations and Bounding boxes in Multimodal Large Language Models for Chest X-ray Report Generation
di: Kim, Yunsoo, et al.
Pubblicazione: (2025)
di: Kim, Yunsoo, et al.
Pubblicazione: (2025)
Beyond Meme Templates: Limitations of Visual Similarity Measures in Meme Matching
di: Hazman, Muzhaffar, et al.
Pubblicazione: (2025)
di: Hazman, Muzhaffar, et al.
Pubblicazione: (2025)
Hierarchical Safety Realignment: Lightweight Restoration of Safety in Pruned Large Vision-Language Models
di: Li, Yue, et al.
Pubblicazione: (2025)
di: Li, Yue, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Benchmarking Egocentric Clinical Intent Understanding Capability for Medical Multimodal Large Language Models
di: Liu, Shaonan, et al.
Pubblicazione: (2026) -
DAMPER: A Dual-Stage Medical Report Generation Framework with Coarse-Grained MeSH Alignment and Fine-Grained Hypergraph Matching
di: Huang, Xiaofei, et al.
Pubblicazione: (2024) -
SurvAgent: Hierarchical CoT-Enhanced Case Banking and Dichotomy-Based Multi-Agent System for Multimodal Survival Prediction
di: Huang, Guolin, et al.
Pubblicazione: (2025) -
Fine-Grained Image-Text Alignment in Medical Imaging Enables Explainable Cyclic Image-Report Generation
di: Chen, Wenting, et al.
Pubblicazione: (2023) -
A Spectrum Evaluation Benchmark for Medical Multi-Modal Large Language Models
di: Liu, Jie, et al.
Pubblicazione: (2024)