Personal Visual Context Learning in Large Multimodal Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xue, Zihui, Baid, Ami, Kim, Sangho, Luo, Mi, Grauman, Kristen |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Don't Let the Video Speak: Audio-Contrastive Preference Optimization for Audio-Visual Language Models
par: Baid, Ami, et autres
Publié: (2026)
par: Baid, Ami, et autres
Publié: (2026)
Seeing the Arrow of Time in Large Multimodal Models
par: Xue, Zihui, et autres
Publié: (2025)
par: Xue, Zihui, et autres
Publié: (2025)
HOI-Swap: Swapping Objects in Videos with Hand-Object Interaction Awareness
par: Xue, Zihui, et autres
Publié: (2024)
par: Xue, Zihui, et autres
Publié: (2024)
Put Myself in Your Shoes: Lifting the Egocentric Perspective from Exocentric Videos
par: Luo, Mi, et autres
Publié: (2024)
par: Luo, Mi, et autres
Publié: (2024)
When Thinking Drifts: Evidential Grounding for Robust Video Reasoning
par: Luo, Mi, et autres
Publié: (2025)
par: Luo, Mi, et autres
Publié: (2025)
Learning Object State Changes in Videos: An Open-World Perspective
par: Xue, Zihui, et autres
Publié: (2023)
par: Xue, Zihui, et autres
Publié: (2023)
Progress-Aware Video Frame Captioning
par: Xue, Zihui, et autres
Publié: (2024)
par: Xue, Zihui, et autres
Publié: (2024)
Action2Sound: Ambient-Aware Generation of Action Sounds from Egocentric Videos
par: Chen, Changan, et autres
Publié: (2024)
par: Chen, Changan, et autres
Publié: (2024)
Detours for Navigating Instructional Videos
par: Ashutosh, Kumar, et autres
Publié: (2024)
par: Ashutosh, Kumar, et autres
Publié: (2024)
Seeing without Pixels: Perception from Camera Trajectories
par: Xue, Zihui, et autres
Publié: (2025)
par: Xue, Zihui, et autres
Publié: (2025)
SPOC: Spatially-Progressing Object State Change Segmentation in Video
par: Mandikal, Priyanka, et autres
Publié: (2025)
par: Mandikal, Priyanka, et autres
Publié: (2025)
Learning Skill-Attributes for Transferable Assessment in Video
par: Ashutosh, Kumar, et autres
Publié: (2025)
par: Ashutosh, Kumar, et autres
Publié: (2025)
ExpertEdit: Learning Skill-Aware Motion Editing from Expert Videos
par: Somayazulu, Arjun, et autres
Publié: (2026)
par: Somayazulu, Arjun, et autres
Publié: (2026)
HieraMamba: Video Temporal Grounding via Hierarchical Anchor-Mamba Pooling
par: An, Joungbin, et autres
Publié: (2025)
par: An, Joungbin, et autres
Publié: (2025)
SkillSight: Efficient First-Person Skill Assessment with Gaze
par: Wu, Chi Hsuan, et autres
Publié: (2025)
par: Wu, Chi Hsuan, et autres
Publié: (2025)
Audio-Visual Camera Pose Estimation with Passive Scene Sounds and In-the-Wild Video
par: Adebi, Daniel, et autres
Publié: (2025)
par: Adebi, Daniel, et autres
Publié: (2025)
UniversalVTG: A Universal and Lightweight Foundation Model for Video Temporal Grounding
par: An, Joungbin, et autres
Publié: (2026)
par: An, Joungbin, et autres
Publié: (2026)
Vid2Coach: Transforming How-To Videos into Task Assistants
par: Huh, Mina, et autres
Publié: (2025)
par: Huh, Mina, et autres
Publié: (2025)
SportSkills: Physical Skill Learning from Sports Instructional Videos
par: Ashutosh, Kumar, et autres
Publié: (2026)
par: Ashutosh, Kumar, et autres
Publié: (2026)
EgoExo-WM: Unlocking Exo Video for Ego World Models
par: Tran, Danny, et autres
Publié: (2026)
par: Tran, Danny, et autres
Publié: (2026)
Learning Spatial Features from Audio-Visual Correspondence in Egocentric Videos
par: Majumder, Sagnik, et autres
Publié: (2023)
par: Majumder, Sagnik, et autres
Publié: (2023)
FIction: 4D Future Interaction Prediction from Video
par: Ashutosh, Kumar, et autres
Publié: (2024)
par: Ashutosh, Kumar, et autres
Publié: (2024)
CODIS: Benchmarking Context-Dependent Visual Comprehension for Multimodal Large Language Models
par: Luo, Fuwen, et autres
Publié: (2024)
par: Luo, Fuwen, et autres
Publié: (2024)
MistExit: Learning to Exit for Early Mistake Detection in Procedural Videos
par: Majumder, Sagnik, et autres
Publié: (2026)
par: Majumder, Sagnik, et autres
Publié: (2026)
Switch-a-View: View Selection Learned from Unlabeled In-the-wild Videos
par: Majumder, Sagnik, et autres
Publié: (2024)
par: Majumder, Sagnik, et autres
Publié: (2024)
Stitch-a-Demo: Video Demonstrations from Multistep Descriptions
par: Wu, Chi Hsuan, et autres
Publié: (2025)
par: Wu, Chi Hsuan, et autres
Publié: (2025)
ActiveRIR: Active Audio-Visual Exploration for Acoustic Environment Modeling
par: Somayazulu, Arjun, et autres
Publié: (2024)
par: Somayazulu, Arjun, et autres
Publié: (2024)
Mash, Spread, Slice! Learning to Manipulate Object States via Visual Spatial Progress
par: Mandikal, Priyanka, et autres
Publié: (2025)
par: Mandikal, Priyanka, et autres
Publié: (2025)
Few-View Object Reconstruction with Unknown Categories and Camera Poses
par: Jiang, Hanwen, et autres
Publié: (2022)
par: Jiang, Hanwen, et autres
Publié: (2022)
LFTR: Learning-Free Token Reduction for Multimodal Large Language Models
par: Zhao, Zihui, et autres
Publié: (2025)
par: Zhao, Zihui, et autres
Publié: (2025)
Visual Representation Alignment for Multimodal Large Language Models
par: Yoon, Heeji, et autres
Publié: (2025)
par: Yoon, Heeji, et autres
Publié: (2025)
Can Language Models Laugh at YouTube Short-form Videos?
par: Ko, Dayoon, et autres
Publié: (2023)
par: Ko, Dayoon, et autres
Publié: (2023)
ViewBridge: Curriculum Knowledge Distillation for Activity View-Invariance Under Extreme Viewpoint Changes
par: Somayazulu, Arjun, et autres
Publié: (2025)
par: Somayazulu, Arjun, et autres
Publié: (2025)
ExpertAF: Expert Actionable Feedback from Video
par: Ashutosh, Kumar, et autres
Publié: (2024)
par: Ashutosh, Kumar, et autres
Publié: (2024)
Shapes as Product Differentiation: Neural Network Embedding in the Analysis of Markets for Fonts
par: Han, Sukjin, et autres
Publié: (2021)
par: Han, Sukjin, et autres
Publié: (2021)
CoVFT: Context-aware Visual Fine-tuning for Multimodal Large Language Models
par: Zhou, Nan, et autres
Publié: (2026)
par: Zhou, Nan, et autres
Publié: (2026)
Which Viewpoint Shows it Best? Language for Weakly Supervising View Selection in Multi-view Instructional Videos
par: Majumder, Sagnik, et autres
Publié: (2024)
par: Majumder, Sagnik, et autres
Publié: (2024)
Machine Vision Therapy: Multimodal Large Language Models Can Enhance Visual Robustness via Denoising In-Context Learning
par: Huang, Zhuo, et autres
Publié: (2023)
par: Huang, Zhuo, et autres
Publié: (2023)
ControlMLLM: Training-Free Visual Prompt Learning for Multimodal Large Language Models
par: Wu, Mingrui, et autres
Publié: (2024)
par: Wu, Mingrui, et autres
Publié: (2024)
Visual In-Context Learning for Large Vision-Language Models
par: Zhou, Yucheng, et autres
Publié: (2024)
par: Zhou, Yucheng, et autres
Publié: (2024)
Documents similaires
-
Don't Let the Video Speak: Audio-Contrastive Preference Optimization for Audio-Visual Language Models
par: Baid, Ami, et autres
Publié: (2026) -
Seeing the Arrow of Time in Large Multimodal Models
par: Xue, Zihui, et autres
Publié: (2025) -
HOI-Swap: Swapping Objects in Videos with Hand-Object Interaction Awareness
par: Xue, Zihui, et autres
Publié: (2024) -
Put Myself in Your Shoes: Lifting the Egocentric Perspective from Exocentric Videos
par: Luo, Mi, et autres
Publié: (2024) -
When Thinking Drifts: Evidential Grounding for Robust Video Reasoning
par: Luo, Mi, et autres
Publié: (2025)