GazeLLM: Multimodal LLMs incorporating Human Visual Attention
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Rekimoto, Jun |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Modeling Subjective Urban Perception with Human Gaze
par: Che, Lin, et autres
Publié: (2026)
par: Che, Lin, et autres
Publié: (2026)
Learning User Embeddings from Human Gaze for Personalised Saliency Prediction
par: Strohm, Florian, et autres
Publié: (2024)
par: Strohm, Florian, et autres
Publié: (2024)
FastPerson: Enhancing Video Learning through Effective Video Summarization that Preserves Linguistic and Visual Contexts
par: Kawamura, Kazuki, et autres
Publié: (2024)
par: Kawamura, Kazuki, et autres
Publié: (2024)
Gaze Detection and Analysis for Initiating Joint Activity in Industrial Human-Robot Collaboration
par: Prajod, Pooja, et autres
Publié: (2023)
par: Prajod, Pooja, et autres
Publié: (2023)
Pose-Robust Calibration Strategy for Point-of-Gaze Estimation on Mobile Phones
par: Zhao, Yujie, et autres
Publié: (2025)
par: Zhao, Yujie, et autres
Publié: (2025)
Learning Spatio-Temporal Feature Representations for Video-Based Gaze Estimation
par: Personnic, Alexandre, et autres
Publié: (2025)
par: Personnic, Alexandre, et autres
Publié: (2025)
The Algorithmic Gaze of Image Quality Assessment: An Audit and Trace Ethnography of the LAION-Aesthetics Predictor
par: Taylor, Jordan, et autres
Publié: (2026)
par: Taylor, Jordan, et autres
Publié: (2026)
Exploring Gaze Pattern Differences Between Autistic and Neurotypical Children: Clustering, Visualisation, and Prediction
par: Shi, Weiyan, et autres
Publié: (2024)
par: Shi, Weiyan, et autres
Publié: (2024)
Multimodal LLM Augmented Reasoning for Interpretable Visual Perception Analysis
par: Chaudhari, Shravan, et autres
Publié: (2025)
par: Chaudhari, Shravan, et autres
Publié: (2025)
Automated Visual Attention Detection using Mobile Eye Tracking in Behavioral Classroom Studies
par: Bozkir, Efe, et autres
Publié: (2025)
par: Bozkir, Efe, et autres
Publié: (2025)
Seeing Eye to AI: Human Alignment via Gaze-Based Response Rewards for Large Language Models
par: Lopez-Cardona, Angela, et autres
Publié: (2024)
par: Lopez-Cardona, Angela, et autres
Publié: (2024)
Simulating Clinical AI Assistance using Multimodal LLMs: A Case Study in Diabetic Retinopathy
par: Barakat, Nadim, et autres
Publié: (2025)
par: Barakat, Nadim, et autres
Publié: (2025)
Vision-Integrated LLMs for Autonomous Driving Assistance : Human Performance Comparison and Trust Evaluation
par: Kim, Namhee, et autres
Publié: (2025)
par: Kim, Namhee, et autres
Publié: (2025)
TraitSpaces: Towards Interpretable Visual Creativity for Human-AI Co-Creation
par: Luthra, Prerna
Publié: (2025)
par: Luthra, Prerna
Publié: (2025)
Evaluating Visual Prompts with Eye-Tracking Data for MLLM-Based Human Activity Recognition
par: Choi, Jae Young, et autres
Publié: (2026)
par: Choi, Jae Young, et autres
Publié: (2026)
See-Control: A Multimodal Agent Framework for Smartphone Interaction with a Robotic Arm
par: Zhao, Haoyu, et autres
Publié: (2025)
par: Zhao, Haoyu, et autres
Publié: (2025)
Gaze patterns predict preference and confidence in pairwise AI image evaluation
par: Papadopoulos, Nikolas, et autres
Publié: (2026)
par: Papadopoulos, Nikolas, et autres
Publié: (2026)
How Good (Or Bad) Are LLMs at Detecting Misleading Visualizations?
par: Lo, Leo Yu-Ho, et autres
Publié: (2024)
par: Lo, Leo Yu-Ho, et autres
Publié: (2024)
Decomposing and Fusing Intra- and Inter-Sensor Spatio-Temporal Signal for Multi-Sensor Wearable Human Activity Recognition
par: Xie, Haoyu, et autres
Publié: (2025)
par: Xie, Haoyu, et autres
Publié: (2025)
Effective Guidance for Model Attention with Simple Yes-no Annotations
par: Lee, Seongmin, et autres
Publié: (2024)
par: Lee, Seongmin, et autres
Publié: (2024)
Realtime Dynamic Gaze Target Tracking and Depth-Level Estimation
par: Seraj, Esmaeil, et autres
Publié: (2024)
par: Seraj, Esmaeil, et autres
Publié: (2024)
"I Can See Forever!": Evaluating Real-time VideoLLMs for Assisting Individuals with Visual Impairments
par: Zhang, Ziyi, et autres
Publié: (2025)
par: Zhang, Ziyi, et autres
Publié: (2025)
EEG-based Multimodal Representation Learning for Emotion Recognition
par: Yin, Kang, et autres
Publié: (2024)
par: Yin, Kang, et autres
Publié: (2024)
AutoTour: Automatic Photo Tour Guide with Smartphones and LLMs
par: Xu, Huatao, et autres
Publié: (2026)
par: Xu, Huatao, et autres
Publié: (2026)
InterFeedback: Unveiling Interactive Intelligence of Large Multimodal Models via Human Feedback
par: Zhao, Henry Hengyuan, et autres
Publié: (2025)
par: Zhao, Henry Hengyuan, et autres
Publié: (2025)
HuLP: Human-in-the-Loop for Prognosis
par: Ridzuan, Muhammad, et autres
Publié: (2024)
par: Ridzuan, Muhammad, et autres
Publié: (2024)
GazeTrack: High-Precision Eye Tracking Based on Regularization and Spatial Computing
par: Yang, Xiaoyin
Publié: (2025)
par: Yang, Xiaoyin
Publié: (2025)
Towards a Multimodal Document-grounded Conversational AI System for Education
par: Taneja, Karan, et autres
Publié: (2025)
par: Taneja, Karan, et autres
Publié: (2025)
OmniResponse: Online Multimodal Conversational Response Generation in Dyadic Interactions
par: Luo, Cheng, et autres
Publié: (2025)
par: Luo, Cheng, et autres
Publié: (2025)
GameWorld: Towards Standardized and Verifiable Evaluation of Multimodal Game Agents
par: Ouyang, Mingyu, et autres
Publié: (2026)
par: Ouyang, Mingyu, et autres
Publié: (2026)
ViSIL: Unified Evaluation of Information Loss in Multimodal Video Captioning
par: Li, Po-han, et autres
Publié: (2026)
par: Li, Po-han, et autres
Publié: (2026)
Benchmarking XAI Explanations with Human-Aligned Evaluations
par: Kazmierczak, Rémi, et autres
Publié: (2024)
par: Kazmierczak, Rémi, et autres
Publié: (2024)
GazeGPT: Augmenting Human Capabilities using Gaze-contingent Contextual AI for Smart Eyewear
par: Konrad, Robert, et autres
Publié: (2024)
par: Konrad, Robert, et autres
Publié: (2024)
Milmer: a Framework for Multiple Instance Learning based Multimodal Emotion Recognition
par: Wang, Zaitian, et autres
Publié: (2025)
par: Wang, Zaitian, et autres
Publié: (2025)
CG-MER: A Card Game-based Multimodal dataset for Emotion Recognition
par: Farhat, Nessrine, et autres
Publié: (2025)
par: Farhat, Nessrine, et autres
Publié: (2025)
ViEEG: Hierarchical Visual Neural Representation for EEG Brain Decoding
par: Liu, Minxu, et autres
Publié: (2025)
par: Liu, Minxu, et autres
Publié: (2025)
Do Vision Language Models Understand Human Engagement in Games?
par: Wang, Ziyi, et autres
Publié: (2026)
par: Wang, Ziyi, et autres
Publié: (2026)
Triple Spectral Fusion for Sensor-based Human Activity Recognition
par: Zhang, Ye, et autres
Publié: (2026)
par: Zhang, Ye, et autres
Publié: (2026)
Exploring Object Status Recognition for Recipe Progress Tracking in Non-Visual Cooking
par: Li, Franklin Mingzhe, et autres
Publié: (2025)
par: Li, Franklin Mingzhe, et autres
Publié: (2025)
AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues
par: Park, Se Jin, et autres
Publié: (2024)
par: Park, Se Jin, et autres
Publié: (2024)
Documents similaires
-
Modeling Subjective Urban Perception with Human Gaze
par: Che, Lin, et autres
Publié: (2026) -
Learning User Embeddings from Human Gaze for Personalised Saliency Prediction
par: Strohm, Florian, et autres
Publié: (2024) -
FastPerson: Enhancing Video Learning through Effective Video Summarization that Preserves Linguistic and Visual Contexts
par: Kawamura, Kazuki, et autres
Publié: (2024) -
Gaze Detection and Analysis for Initiating Joint Activity in Industrial Human-Robot Collaboration
par: Prajod, Pooja, et autres
Publié: (2023) -
Pose-Robust Calibration Strategy for Point-of-Gaze Estimation on Mobile Phones
par: Zhao, Yujie, et autres
Publié: (2025)