Eye-gaze Guided Multi-modal Alignment for Medical Representation Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ma, Chong, Jiang, Hanqi, Chen, Wenting, Li, Yiwei, Wu, Zihao, Yu, Xiaowei, Liu, Zhengliang, Guo, Lei, Zhu, Dajiang, Zhang, Tuo, Shen, Dinggang, Liu, Tianming, Li, Xiang |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Event-based Solutions for Human-centered Applications: A Comprehensive Review
par: Adra, Mira, et autres
Publié: (2025)
par: Adra, Mira, et autres
Publié: (2025)
A Review of Pseudo-Labeling for Computer Vision
par: Kage, Patrick, et autres
Publié: (2024)
par: Kage, Patrick, et autres
Publié: (2024)
Unified Local and Global Attention Interaction Modeling for Vision Transformers
par: Nguyen, Tan, et autres
Publié: (2024)
par: Nguyen, Tan, et autres
Publié: (2024)
Efficient Neural Network Encoding for 3D Color Lookup Tables
par: Zehtab, Vahid, et autres
Publié: (2024)
par: Zehtab, Vahid, et autres
Publié: (2024)
CerberusDet: Unified Multi-Dataset Object Detection
par: Tolstykh, Irina, et autres
Publié: (2024)
par: Tolstykh, Irina, et autres
Publié: (2024)
Multimodal Approaches for Visually-Rich Document Type Classification: A Comparative Analysis
par: Heyne, Catyana, et autres
Publié: (2026)
par: Heyne, Catyana, et autres
Publié: (2026)
Proto-FG3D: Prototype-based Interpretable Fine-Grained 3D Shape Classification
par: Ma, Shuxian, et autres
Publié: (2025)
par: Ma, Shuxian, et autres
Publié: (2025)
ViFiCon: Vision and Wireless Association Via Self-Supervised Contrastive Learning
par: Meegan, Nicholas, et autres
Publié: (2022)
par: Meegan, Nicholas, et autres
Publié: (2022)
Threats and Opportunities in AI-generated Images for Armed Forces
par: Meier, Raphael
Publié: (2025)
par: Meier, Raphael
Publié: (2025)
SpATr: MoCap 3D Human Action Recognition based on Spiral Auto-encoder and Transformer Network
par: Bouzid, Hamza, et autres
Publié: (2023)
par: Bouzid, Hamza, et autres
Publié: (2023)
Efficient Diffusion Training through Parallelization with Truncated Karhunen-Loève Expansion
par: Ren, Yumeng, et autres
Publié: (2025)
par: Ren, Yumeng, et autres
Publié: (2025)
Making High-Level AI Design Decisions Explicit Using a Binary Stream System-Designation Approach
par: Mossbridge, Julia
Publié: (2024)
par: Mossbridge, Julia
Publié: (2024)
Synthetic Photography Detection: A Visual Guidance for Identifying Synthetic Images Created by AI
par: Mathys, Melanie, et autres
Publié: (2024)
par: Mathys, Melanie, et autres
Publié: (2024)
Seeing The Words: Evaluating AI-generated Biblical Art
par: Makimei, Hidde, et autres
Publié: (2025)
par: Makimei, Hidde, et autres
Publié: (2025)
Event Detection via Probability Density Function Regression
par: Peng, Clark, et autres
Publié: (2024)
par: Peng, Clark, et autres
Publié: (2024)
Evaluating ML Robustness in GNSS Interference Classification, Characterization & Localization
par: Heublein, Lucas, et autres
Publié: (2024)
par: Heublein, Lucas, et autres
Publié: (2024)
Bridging SFT and DPO for Diffusion Model Alignment with Self-Sampling Preference Optimization
par: Zhang, Daoan, et autres
Publié: (2024)
par: Zhang, Daoan, et autres
Publié: (2024)
COLORA: Efficient Fine-Tuning for Convolutional Models with a Study Case on Optical Coherence Tomography Image Classification
par: Rivera, Mariano, et autres
Publié: (2025)
par: Rivera, Mariano, et autres
Publié: (2025)
A Human-Machine Collaboration Framework for the Development of Schemas
par: Isaak, Nicos
Publié: (2024)
par: Isaak, Nicos
Publié: (2024)
Empowering VLMs for Few-Shot Multimodal Time Series Classification via Tailored Agentic Reasoning
par: Li, Lin, et autres
Publié: (2026)
par: Li, Lin, et autres
Publié: (2026)
StereoCrafter: Diffusion-based Generation of Long and High-fidelity Stereoscopic 3D from Monocular Videos
par: Zhao, Sijie, et autres
Publié: (2024)
par: Zhao, Sijie, et autres
Publié: (2024)
Deep Domain Adaptation: A Sim2Real Neural Approach for Improving Eye-Tracking Systems
par: Nguyen, Viet Dung, et autres
Publié: (2024)
par: Nguyen, Viet Dung, et autres
Publié: (2024)
Enhancing Eye Feature Estimation from Event Data Streams through Adaptive Inference State Space Modeling
par: Nguyen, Viet Dung, et autres
Publié: (2026)
par: Nguyen, Viet Dung, et autres
Publié: (2026)
Vision Transformer-based Model for Severity Quantification of Lung Pneumonia Using Chest X-ray Images
par: Slika, Bouthaina, et autres
Publié: (2023)
par: Slika, Bouthaina, et autres
Publié: (2023)
Synthetic Image Generation in Cyber Influence Operations: An Emergent Threat?
par: Mathys, Melanie, et autres
Publié: (2024)
par: Mathys, Melanie, et autres
Publié: (2024)
Beyond Specialization: Assessing the Capabilities of MLLMs in Age and Gender Estimation
par: Kuprashevich, Maksim, et autres
Publié: (2024)
par: Kuprashevich, Maksim, et autres
Publié: (2024)
Interpreting Structured Perturbations in Image Protection Methods for Diffusion Models
par: Martin, Michael R., et autres
Publié: (2025)
par: Martin, Michael R., et autres
Publié: (2025)
Equip Pre-ranking with Target Attention by Residual Quantization
par: Li, Yutong, et autres
Publié: (2025)
par: Li, Yutong, et autres
Publié: (2025)
Few-Class Arena: A Benchmark for Efficient Selection of Vision Models and Dataset Difficulty Measurement
par: Cao, Bryan Bo, et autres
Publié: (2024)
par: Cao, Bryan Bo, et autres
Publié: (2024)
FUTURE-AI: International consensus guideline for trustworthy and deployable artificial intelligence in healthcare
par: Lekadir, Karim, et autres
Publié: (2023)
par: Lekadir, Karim, et autres
Publié: (2023)
Quaternion Convolutional Neural Networks: Current Advances and Future Directions
par: Altamirano-Gomez, Gerardo, et autres
Publié: (2023)
par: Altamirano-Gomez, Gerardo, et autres
Publié: (2023)
Explainable Classifier for Malignant Lymphoma Subtyping via Cell Graph and Image Fusion
par: Nishiyama, Daiki, et autres
Publié: (2025)
par: Nishiyama, Daiki, et autres
Publié: (2025)
Doodle Your Keypoints: Sketch-Based Few-Shot Keypoint Detection
par: Maity, Subhajit, et autres
Publié: (2025)
par: Maity, Subhajit, et autres
Publié: (2025)
High-Entropy Tokens as Multimodal Failure Points in Vision-Language Models
par: He, Mengqi, et autres
Publié: (2025)
par: He, Mengqi, et autres
Publié: (2025)
Context-Aware Full Body Anonymization using Text-to-Image Diffusion Models
par: Zwick, Pascal, et autres
Publié: (2024)
par: Zwick, Pascal, et autres
Publié: (2024)
Goal-conditioned reinforcement learning for ultrasound navigation guidance
par: Amadou, Abdoul Aziz, et autres
Publié: (2024)
par: Amadou, Abdoul Aziz, et autres
Publié: (2024)
StatsMerging: Statistics-Guided Model Merging via Task-Specific Teacher Distillation
par: Merugu, Ranjith, et autres
Publié: (2025)
par: Merugu, Ranjith, et autres
Publié: (2025)
AzSLD: Azerbaijani Sign Language Dataset for Fingerspelling, Word, and Sentence Translation with Baseline Software
par: Alishzade, Nigar, et autres
Publié: (2024)
par: Alishzade, Nigar, et autres
Publié: (2024)
Multi-Objective Optimization for Synthetic-to-Real Style Transfer
par: Chigot, Estelle, et autres
Publié: (2026)
par: Chigot, Estelle, et autres
Publié: (2026)
Foreground Focus: Enhancing Coherence and Fidelity in Camouflaged Image Generation
par: Chen, Pei-Chi, et autres
Publié: (2025)
par: Chen, Pei-Chi, et autres
Publié: (2025)
Documents similaires
-
Event-based Solutions for Human-centered Applications: A Comprehensive Review
par: Adra, Mira, et autres
Publié: (2025) -
A Review of Pseudo-Labeling for Computer Vision
par: Kage, Patrick, et autres
Publié: (2024) -
Unified Local and Global Attention Interaction Modeling for Vision Transformers
par: Nguyen, Tan, et autres
Publié: (2024) -
Efficient Neural Network Encoding for 3D Color Lookup Tables
par: Zehtab, Vahid, et autres
Publié: (2024) -
CerberusDet: Unified Multi-Dataset Object Detection
par: Tolstykh, Irina, et autres
Publié: (2024)