GLOV: Guided Large Language Models as Implicit Optimizers for Vision Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Mirza, M. Jehanzeb, Zhao, Mengjie, Mao, Zhuoyuan, Doveh, Sivan, Lin, Wei, Gavrikov, Paul, Dorkenwald, Michael, Yang, Shiqi, Jha, Saurav, Wakaki, Hiromi, Mitsufuji, Yuki, Possegger, Horst, Feris, Rogerio, Karlinsky, Leonid, Glass, James |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Comparison Visual Instruction Tuning
por: Lin, Wei, et al.
Publicado: (2024)
por: Lin, Wei, et al.
Publicado: (2024)
TTRV: Test-Time Reinforcement Learning for Vision Language Models
por: Singh, Akshit, et al.
Publicado: (2025)
por: Singh, Akshit, et al.
Publicado: (2025)
PRISMM-Bench: A Benchmark of Peer-Review Grounded Multimodal Inconsistencies
por: Selch, Lukas, et al.
Publicado: (2025)
por: Selch, Lukas, et al.
Publicado: (2025)
Meta-Prompting for Automating Zero-shot Visual Recognition with LLMs
por: Mirza, M. Jehanzeb, et al.
Publicado: (2024)
por: Mirza, M. Jehanzeb, et al.
Publicado: (2024)
Towards Multimodal In-Context Learning for Vision & Language Models
por: Doveh, Sivan, et al.
Publicado: (2024)
por: Doveh, Sivan, et al.
Publicado: (2024)
DeepResonance: Enhancing Multimodal Music Understanding via Music-centric Multi-way Instruction Tuning
por: Mao, Zhuoyuan, et al.
Publicado: (2025)
por: Mao, Zhuoyuan, et al.
Publicado: (2025)
Teaching VLMs to Localize Specific Objects from In-context Examples
por: Doveh, Sivan, et al.
Publicado: (2024)
por: Doveh, Sivan, et al.
Publicado: (2024)
State-Space Large Audio Language Models
por: Bhati, Saurabhchand, et al.
Publicado: (2024)
por: Bhati, Saurabhchand, et al.
Publicado: (2024)
Exploring Modality Guidance to Enhance VFM-based Feature Fusion for UDA in 3D Semantic Segmentation
por: Spoecklberger, Johannes, et al.
Publicado: (2025)
por: Spoecklberger, Johannes, et al.
Publicado: (2025)
CALM: Class-Conditional Sparse Attention Vectors for Large Audio-Language Models
por: Mehta, Videet, et al.
Publicado: (2026)
por: Mehta, Videet, et al.
Publicado: (2026)
Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion
por: Hansen, Jacob, et al.
Publicado: (2025)
por: Hansen, Jacob, et al.
Publicado: (2025)
Mining Your Own Secrets: Diffusion Classifier Scores for Continual Personalization of Text-to-Image Diffusion Models
por: Jha, Saurav, et al.
Publicado: (2024)
por: Jha, Saurav, et al.
Publicado: (2024)
OpenMU: Your Swiss Army Knife for Music Understanding
por: Zhao, Mengjie, et al.
Publicado: (2024)
por: Zhao, Mengjie, et al.
Publicado: (2024)
DASS: Distilled Audio State Space Models Are Stronger and More Duration-Scalable Learners
por: Bhati, Saurabhchand, et al.
Publicado: (2024)
por: Bhati, Saurabhchand, et al.
Publicado: (2024)
Probing the effectiveness of World Models for Spatial Reasoning through Test-time Scaling
por: Jha, Saurav, et al.
Publicado: (2025)
por: Jha, Saurav, et al.
Publicado: (2025)
Cross-Modal Learning for Music-to-Music-Video Description Generation
por: Mao, Zhuoyuan, et al.
Publicado: (2025)
por: Mao, Zhuoyuan, et al.
Publicado: (2025)
VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes
por: Gavrikov, Paul, et al.
Publicado: (2025)
por: Gavrikov, Paul, et al.
Publicado: (2025)
Learning to Route Languages for Multilingual Policy Optimization
por: Guo, Geyang, et al.
Publicado: (2026)
por: Guo, Geyang, et al.
Publicado: (2026)
Self-Specialization: Uncovering Latent Expertise within Large Language Models
por: Kang, Junmo, et al.
Publicado: (2023)
por: Kang, Junmo, et al.
Publicado: (2023)
Latent Implicit Visual Reasoning
por: Li, Kelvin, et al.
Publicado: (2025)
por: Li, Kelvin, et al.
Publicado: (2025)
CAMELoT: Towards Large Language Models with Training-Free Consolidated Associative Memory
por: He, Zexue, et al.
Publicado: (2024)
por: He, Zexue, et al.
Publicado: (2024)
ConMe: Rethinking Evaluation of Compositional Reasoning for Modern VLMs
por: Huang, Irene, et al.
Publicado: (2024)
por: Huang, Irene, et al.
Publicado: (2024)
DiffuCOMET: Contextual Commonsense Knowledge Diffusion
por: Gao, Silin, et al.
Publicado: (2024)
por: Gao, Silin, et al.
Publicado: (2024)
MAEDAY: MAE for few and zero shot AnomalY-Detection
por: Schwartz, Eli, et al.
Publicado: (2022)
por: Schwartz, Eli, et al.
Publicado: (2022)
Self-MoE: Towards Compositional Large Language Models with Self-Specialized Experts
por: Kang, Junmo, et al.
Publicado: (2024)
por: Kang, Junmo, et al.
Publicado: (2024)
NumeroLogic: Number Encoding for Enhanced LLMs' Numerical Reasoning
por: Schwartz, Eli, et al.
Publicado: (2024)
por: Schwartz, Eli, et al.
Publicado: (2024)
Whisper-Flamingo: Integrating Visual Features into Whisper for Audio-Visual Speech Recognition and Translation
por: Rouditchenko, Andrew, et al.
Publicado: (2024)
por: Rouditchenko, Andrew, et al.
Publicado: (2024)
LiveXiv -- A Multi-Modal Live Benchmark Based on Arxiv Papers Content
por: Shabtay, Nimrod, et al.
Publicado: (2024)
por: Shabtay, Nimrod, et al.
Publicado: (2024)
Overflow Prevention Enhances Long-Context Recurrent LLMs
por: Ben-Kish, Assaf, et al.
Publicado: (2025)
por: Ben-Kish, Assaf, et al.
Publicado: (2025)
Towards Audio Token Compression in Large Audio Language Models
por: Bhati, Saurabhchand, et al.
Publicado: (2025)
por: Bhati, Saurabhchand, et al.
Publicado: (2025)
Navigating the Labyrinth: Evaluating LLMs' Ability to Reason About Search Problems
por: Borazjanizadeh, Nasim, et al.
Publicado: (2024)
por: Borazjanizadeh, Nasim, et al.
Publicado: (2024)
Into the Fog: Evaluating Robustness of Multiple Object Tracking
por: Kirillova, Nadezda, et al.
Publicado: (2024)
por: Kirillova, Nadezda, et al.
Publicado: (2024)
Demystifying MaskGIT Sampler and Beyond: Adaptive Order Selection in Masked Diffusion
por: Hayakawa, Satoshi, et al.
Publicado: (2025)
por: Hayakawa, Satoshi, et al.
Publicado: (2025)
Distillation of Discrete Diffusion through Dimensional Correlations
por: Hayakawa, Satoshi, et al.
Publicado: (2024)
por: Hayakawa, Satoshi, et al.
Publicado: (2024)
$\texttt{BATCLIP}$: Bimodal Online Test-Time Adaptation for CLIP
por: Maharana, Sarthak Kumar, et al.
Publicado: (2024)
por: Maharana, Sarthak Kumar, et al.
Publicado: (2024)
KV Cache Steering for Controlling Frozen LLMs
por: Belitsky, Max, et al.
Publicado: (2025)
por: Belitsky, Max, et al.
Publicado: (2025)
AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers
por: Araujo, Edson, et al.
Publicado: (2026)
por: Araujo, Edson, et al.
Publicado: (2026)
ComperDial: Commonsense Persona-grounded Dialogue Dataset and Benchmark
por: Wakaki, Hiromi, et al.
Publicado: (2024)
por: Wakaki, Hiromi, et al.
Publicado: (2024)
Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features
por: Mitra, Chancharik, et al.
Publicado: (2024)
por: Mitra, Chancharik, et al.
Publicado: (2024)
Visualizing Thought: Conceptual Diagrams Enable Robust Planning in LMMs
por: Borazjanizadeh, Nasim, et al.
Publicado: (2025)
por: Borazjanizadeh, Nasim, et al.
Publicado: (2025)
Ejemplares similares
-
Comparison Visual Instruction Tuning
por: Lin, Wei, et al.
Publicado: (2024) -
TTRV: Test-Time Reinforcement Learning for Vision Language Models
por: Singh, Akshit, et al.
Publicado: (2025) -
PRISMM-Bench: A Benchmark of Peer-Review Grounded Multimodal Inconsistencies
por: Selch, Lukas, et al.
Publicado: (2025) -
Meta-Prompting for Automating Zero-shot Visual Recognition with LLMs
por: Mirza, M. Jehanzeb, et al.
Publicado: (2024) -
Towards Multimodal In-Context Learning for Vision & Language Models
por: Doveh, Sivan, et al.
Publicado: (2024)