Latent Implicit Visual Reasoning
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Kelvin, Shang, Chuyi, Karlinsky, Leonid, Feris, Rogerio, Darrell, Trevor, Herzig, Roei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DAVE: A VLM Vision Encoder for Document Understanding and Web Agents
por: Huang, Brandon, et al.
Publicado: (2025)
por: Huang, Brandon, et al.
Publicado: (2025)
TraveLER: A Modular Multi-LMM Agent Framework for Video Question-Answering
por: Shang, Chuyi, et al.
Publicado: (2024)
por: Shang, Chuyi, et al.
Publicado: (2024)
Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features
por: Mitra, Chancharik, et al.
Publicado: (2024)
por: Mitra, Chancharik, et al.
Publicado: (2024)
Multimodal Task Vectors Enable Many-Shot Multimodal In-Context Learning
por: Huang, Brandon, et al.
Publicado: (2024)
por: Huang, Brandon, et al.
Publicado: (2024)
Activation Reward Models for Few-Shot Model Alignment
por: Chai, Tianning, et al.
Publicado: (2025)
por: Chai, Tianning, et al.
Publicado: (2025)
Navigating the Labyrinth: Evaluating LLMs' Ability to Reason About Search Problems
por: Borazjanizadeh, Nasim, et al.
Publicado: (2024)
por: Borazjanizadeh, Nasim, et al.
Publicado: (2024)
ConMe: Rethinking Evaluation of Compositional Reasoning for Modern VLMs
por: Huang, Irene, et al.
Publicado: (2024)
por: Huang, Irene, et al.
Publicado: (2024)
Recursive Visual Programming
por: Ge, Jiaxin, et al.
Publicado: (2023)
por: Ge, Jiaxin, et al.
Publicado: (2023)
Compositional Chain-of-Thought Prompting for Large Multimodal Models
por: Mitra, Chancharik, et al.
Publicado: (2023)
por: Mitra, Chancharik, et al.
Publicado: (2023)
$\texttt{BATCLIP}$: Bimodal Online Test-Time Adaptation for CLIP
por: Maharana, Sarthak Kumar, et al.
Publicado: (2024)
por: Maharana, Sarthak Kumar, et al.
Publicado: (2024)
Visualizing Thought: Conceptual Diagrams Enable Robust Planning in LMMs
por: Borazjanizadeh, Nasim, et al.
Publicado: (2025)
por: Borazjanizadeh, Nasim, et al.
Publicado: (2025)
Comparison Visual Instruction Tuning
por: Lin, Wei, et al.
Publicado: (2024)
por: Lin, Wei, et al.
Publicado: (2024)
Whisper-Flamingo: Integrating Visual Features into Whisper for Audio-Visual Speech Recognition and Translation
por: Rouditchenko, Andrew, et al.
Publicado: (2024)
por: Rouditchenko, Andrew, et al.
Publicado: (2024)
Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion
por: Hansen, Jacob, et al.
Publicado: (2025)
por: Hansen, Jacob, et al.
Publicado: (2025)
Adaptive Memory Replay for Continual Learning
por: Smith, James Seale, et al.
Publicado: (2024)
por: Smith, James Seale, et al.
Publicado: (2024)
From Generated Human Videos to Physically Plausible Robot Trajectories
por: Ni, James, et al.
Publicado: (2025)
por: Ni, James, et al.
Publicado: (2025)
GLOV: Guided Large Language Models as Implicit Optimizers for Vision Language Models
por: Mirza, M. Jehanzeb, et al.
Publicado: (2024)
por: Mirza, M. Jehanzeb, et al.
Publicado: (2024)
LLARVA: Vision-Action Instruction Tuning Enhances Robot Learning
por: Niu, Dantong, et al.
Publicado: (2024)
por: Niu, Dantong, et al.
Publicado: (2024)
3VL: Using Trees to Improve Vision-Language Models' Interpretability
por: Yellinek, Nir, et al.
Publicado: (2023)
por: Yellinek, Nir, et al.
Publicado: (2023)
Sample- and Parameter-Efficient Auto-Regressive Image Models
por: Amrani, Elad, et al.
Publicado: (2024)
por: Amrani, Elad, et al.
Publicado: (2024)
Video-R4: Reinforcing Text-Rich Video Reasoning with Visual Rumination
por: Tang, Yolo Y., et al.
Publicado: (2025)
por: Tang, Yolo Y., et al.
Publicado: (2025)
Mechanistic Finetuning of Vision-Language-Action Models via Few-Shot Demonstrations
por: Mitra, Chancharik, et al.
Publicado: (2025)
por: Mitra, Chancharik, et al.
Publicado: (2025)
CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment
por: Araujo, Edson, et al.
Publicado: (2025)
por: Araujo, Edson, et al.
Publicado: (2025)
Teaching VLMs to Localize Specific Objects from In-context Examples
por: Doveh, Sivan, et al.
Publicado: (2024)
por: Doveh, Sivan, et al.
Publicado: (2024)
Composition-Grounded Data Synthesis for Visual Reasoning
por: Gu, Xinyi, et al.
Publicado: (2025)
por: Gu, Xinyi, et al.
Publicado: (2025)
Finding Visual Task Vectors
por: Hojel, Alberto, et al.
Publicado: (2024)
por: Hojel, Alberto, et al.
Publicado: (2024)
TULIP: Towards Unified Language-Image Pretraining
por: Tang, Zineng, et al.
Publicado: (2025)
por: Tang, Zineng, et al.
Publicado: (2025)
AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers
por: Araujo, Edson, et al.
Publicado: (2026)
por: Araujo, Edson, et al.
Publicado: (2026)
Latent Visual Reasoning
por: Li, Bangzheng, et al.
Publicado: (2025)
por: Li, Bangzheng, et al.
Publicado: (2025)
Learning to Grasp Anything by Playing with Random Toys
por: Niu, Dantong, et al.
Publicado: (2025)
por: Niu, Dantong, et al.
Publicado: (2025)
mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition
por: Rouditchenko, Andrew, et al.
Publicado: (2025)
por: Rouditchenko, Andrew, et al.
Publicado: (2025)
LLM-grounded Diffusion: Enhancing Prompt Understanding of Text-to-Image Diffusion Models with Large Language Models
por: Lian, Long, et al.
Publicado: (2023)
por: Lian, Long, et al.
Publicado: (2023)
Latent Sketchpad: Sketching Visual Thoughts to Elicit Multimodal Reasoning in MLLMs
por: Zhang, Huanyu, et al.
Publicado: (2025)
por: Zhang, Huanyu, et al.
Publicado: (2025)
Semantic-Enriched Latent Visual Reasoning
por: Xu, Tianrun, et al.
Publicado: (2026)
por: Xu, Tianrun, et al.
Publicado: (2026)
Leveraging Latent Visual Reasoning in Silence
por: Zhu, Dongyao, et al.
Publicado: (2026)
por: Zhu, Dongyao, et al.
Publicado: (2026)
MementoGUI: Learning Agentic Multimodal Memory Control for Long-Horizon GUI Agents
por: Zeng, Ziyun, et al.
Publicado: (2026)
por: Zeng, Ziyun, et al.
Publicado: (2026)
Clue Matters: Leveraging Latent Visual Clues to Empower Video Reasoning
por: zhang, Kaixin, et al.
Publicado: (2026)
por: zhang, Kaixin, et al.
Publicado: (2026)
Interleaved Latent Visual Reasoning with Selective Perceptual Modeling
por: Dong, Shuai, et al.
Publicado: (2025)
por: Dong, Shuai, et al.
Publicado: (2025)
TTA-Vid: Generalized Test-Time Adaptation for Video Reasoning
por: Jahagirdar, Soumya Shamarao, et al.
Publicado: (2026)
por: Jahagirdar, Soumya Shamarao, et al.
Publicado: (2026)
MAEDAY: MAE for few and zero shot AnomalY-Detection
por: Schwartz, Eli, et al.
Publicado: (2022)
por: Schwartz, Eli, et al.
Publicado: (2022)
Ejemplares similares
-
DAVE: A VLM Vision Encoder for Document Understanding and Web Agents
por: Huang, Brandon, et al.
Publicado: (2025) -
TraveLER: A Modular Multi-LMM Agent Framework for Video Question-Answering
por: Shang, Chuyi, et al.
Publicado: (2024) -
Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features
por: Mitra, Chancharik, et al.
Publicado: (2024) -
Multimodal Task Vectors Enable Many-Shot Multimodal In-Context Learning
por: Huang, Brandon, et al.
Publicado: (2024) -
Activation Reward Models for Few-Shot Model Alignment
por: Chai, Tianning, et al.
Publicado: (2025)