Thinking with Gaze: Sequential Eye-Tracking as Visual Reasoning Supervision for Medical VLMs
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Yiwei, Wu, Zihao, Lv, Yanjun, Jiang, Hanqi, You, Weihang, Liu, Zhengliang, Zhu, Dajiang, Li, Xiang, Li, Quanzheng, Liu, Tianming, Zhao, Lin |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
EG-SpikeFormer: Eye-Gaze Guided Transformer on Spiking Neural Networks for Medical Image Analysis
by: Pan, Yi, et al.
Published: (2024)
by: Pan, Yi, et al.
Published: (2024)
Eye-gaze Guided Multi-modal Alignment for Medical Representation Learning
by: Ma, Chong, et al.
Published: (2024)
by: Ma, Chong, et al.
Published: (2024)
Artificial General Intelligence for Medical Imaging Analysis
by: Li, Xiang, et al.
Published: (2023)
by: Li, Xiang, et al.
Published: (2023)
MKRAG: Medical Knowledge Retrieval Augmented Generation for Medical Question Answering
by: Shi, Yucheng, et al.
Published: (2023)
by: Shi, Yucheng, et al.
Published: (2023)
MGH Radiology Llama: A Llama 3 70B Model for Radiology
by: Shi, Yucheng, et al.
Published: (2024)
by: Shi, Yucheng, et al.
Published: (2024)
Towards Next-Generation Medical Agent: How o1 is Reshaping Decision-Making in Medical Scenarios
by: Xu, Shaochen, et al.
Published: (2024)
by: Xu, Shaochen, et al.
Published: (2024)
World Models: A Comprehensive Survey of Architectures, Methodologies, Reasoning Paradigms, and Applications
by: Zidan, Arif Hassan, et al.
Published: (2026)
by: Zidan, Arif Hassan, et al.
Published: (2026)
DeID-GPT: Zero-shot Medical Text De-Identification by GPT-4
by: Liu, Zhengliang, et al.
Published: (2023)
by: Liu, Zhengliang, et al.
Published: (2023)
ECHOPulse: ECG controlled echocardio-grams video generation
by: Li, Yiwei, et al.
Published: (2024)
by: Li, Yiwei, et al.
Published: (2024)
GP-GPT: Large Language Model for Gene-Phenotype Mapping
by: Lyu, Yanjun, et al.
Published: (2024)
by: Lyu, Yanjun, et al.
Published: (2024)
Opportunities and Challenges of Large Language Models for Low-Resource Languages in Humanities Research
by: Zhong, Tianyang, et al.
Published: (2024)
by: Zhong, Tianyang, et al.
Published: (2024)
Differentiate ChatGPT-generated and Human-written Medical Texts
by: Liao, Wenxiong, et al.
Published: (2023)
by: Liao, Wenxiong, et al.
Published: (2023)
A World Model of Radiologist Reading for Medical Image Representation Learning
by: Li, Yiwei, et al.
Published: (2026)
by: Li, Yiwei, et al.
Published: (2026)
Think Twice to See More: Iterative Visual Reasoning in Medical VLMs
by: Chen, Kaitao, et al.
Published: (2025)
by: Chen, Kaitao, et al.
Published: (2025)
Large Language Models for Assisting American College Applications
by: Liu, Zhengliang, et al.
Published: (2026)
by: Liu, Zhengliang, et al.
Published: (2026)
Achieving Fine-grained Cross-modal Understanding through Brain-inspired Hierarchical Representation Learning
by: You, Weihang, et al.
Published: (2026)
by: You, Weihang, et al.
Published: (2026)
LLM-POTUS Score: A Framework of Analyzing Presidential Debates with Large Language Models
by: Liu, Zhengliang, et al.
Published: (2024)
by: Liu, Zhengliang, et al.
Published: (2024)
SearchRAG: Can Search Engines Be Helpful for LLM-based Medical Question Answering?
by: Shi, Yucheng, et al.
Published: (2025)
by: Shi, Yucheng, et al.
Published: (2025)
MolQAE: Quantum Autoencoder for Molecular Representation Learning
by: Pan, Yi, et al.
Published: (2025)
by: Pan, Yi, et al.
Published: (2025)
ADLGen: Synthesizing Symbolic, Event-Triggered Sensor Sequences for Human Activity Modeling
by: You, Weihang, et al.
Published: (2025)
by: You, Weihang, et al.
Published: (2025)
SemVink: Advancing VLMs' Semantic Understanding of Optical Illusions via Visual Global Thinking
by: Li, Sifan, et al.
Published: (2025)
by: Li, Sifan, et al.
Published: (2025)
SAMAug: Point Prompt Augmentation for Segment Anything Model
by: Dai, Haixing, et al.
Published: (2023)
by: Dai, Haixing, et al.
Published: (2023)
OracleSage: Towards Unified Visual-Linguistic Understanding of Oracle Bone Scripts through Cross-Modal Knowledge Fusion
by: Jiang, Hanqi, et al.
Published: (2024)
by: Jiang, Hanqi, et al.
Published: (2024)
MediViSTA: Medical Video Segmentation via Temporal Fusion SAM Adaptation for Echocardiography
by: Kim, Sekeun, et al.
Published: (2023)
by: Kim, Sekeun, et al.
Published: (2023)
Vibe Medicine: Redefining Biomedical Research Through Human-AI Co-Work
by: Wu, Zihao, et al.
Published: (2026)
by: Wu, Zihao, et al.
Published: (2026)
Foundation Models for Low-Resource Language Education (Vision Paper)
by: Ding, Zhaojun, et al.
Published: (2024)
by: Ding, Zhaojun, et al.
Published: (2024)
ViThinker: Active Vision-Language Reasoning via Dynamic Perceptual Querying
by: You, Weihang, et al.
Published: (2026)
by: You, Weihang, et al.
Published: (2026)
QueEn: A Large Language Model for Quechua-English Translation
by: Chen, Junhao, et al.
Published: (2024)
by: Chen, Junhao, et al.
Published: (2024)
Reasoning before Comparison: LLM-Enhanced Semantic Similarity Metrics for Domain Specialized Text Analysis
by: Xu, Shaochen, et al.
Published: (2024)
by: Xu, Shaochen, et al.
Published: (2024)
Eye Gaze Tells You Where to Compute: Gaze-Driven Efficient VLMs
by: Chen, Qinyu, et al.
Published: (2025)
by: Chen, Qinyu, et al.
Published: (2025)
Radiology-GPT: A Large Language Model for Radiology
by: Liu, Zhengliang, et al.
Published: (2023)
by: Liu, Zhengliang, et al.
Published: (2023)
Conditional Evidence Reconstruction and Decomposition for Interpretable Multimodal Diagnosis
by: Wan, Shaowen, et al.
Published: (2026)
by: Wan, Shaowen, et al.
Published: (2026)
Examining the Commitments and Difficulties Inherent in Multimodal Foundation Models for Street View Imagery
by: Yang, Zhenyuan, et al.
Published: (2024)
by: Yang, Zhenyuan, et al.
Published: (2024)
LLMs for Coding and Robotics Education
by: Shu, Peng, et al.
Published: (2024)
by: Shu, Peng, et al.
Published: (2024)
Mask-guided BERT for Few Shot Text Classification
by: Liao, Wenxiong, et al.
Published: (2023)
by: Liao, Wenxiong, et al.
Published: (2023)
EchoFM: Foundation Model for Generalizable Echocardiogram Analysis
by: Kim, Sekeun, et al.
Published: (2024)
by: Kim, Sekeun, et al.
Published: (2024)
ALDM-Grasping: Diffusion-aided Zero-Shot Sim-to-Real Transfer for Robot Grasping
by: Li, Yiwei, et al.
Published: (2024)
by: Li, Yiwei, et al.
Published: (2024)
Stable Tracking of Eye Gaze Direction During Ophthalmic Surgery
by: Hong, Tinghe, et al.
Published: (2025)
by: Hong, Tinghe, et al.
Published: (2025)
Focusing by Contrastive Attention: Enhancing VLMs' Visual Reasoning
by: Ge, Yuyao, et al.
Published: (2025)
by: Ge, Yuyao, et al.
Published: (2025)
Coarse-to-fine Knowledge Graph Domain Adaptation based on Distantly-supervised Iterative Training
by: Cai, Hongmin, et al.
Published: (2022)
by: Cai, Hongmin, et al.
Published: (2022)
Similar Items
-
EG-SpikeFormer: Eye-Gaze Guided Transformer on Spiking Neural Networks for Medical Image Analysis
by: Pan, Yi, et al.
Published: (2024) -
Eye-gaze Guided Multi-modal Alignment for Medical Representation Learning
by: Ma, Chong, et al.
Published: (2024) -
Artificial General Intelligence for Medical Imaging Analysis
by: Li, Xiang, et al.
Published: (2023) -
MKRAG: Medical Knowledge Retrieval Augmented Generation for Medical Question Answering
by: Shi, Yucheng, et al.
Published: (2023) -
MGH Radiology Llama: A Llama 3 70B Model for Radiology
by: Shi, Yucheng, et al.
Published: (2024)