GLOV: Guided Large Language Models as Implicit Optimizers for Vision Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Mirza, M. Jehanzeb, Zhao, Mengjie, Mao, Zhuoyuan, Doveh, Sivan, Lin, Wei, Gavrikov, Paul, Dorkenwald, Michael, Yang, Shiqi, Jha, Saurav, Wakaki, Hiromi, Mitsufuji, Yuki, Possegger, Horst, Feris, Rogerio, Karlinsky, Leonid, Glass, James |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Comparison Visual Instruction Tuning
di: Lin, Wei, et al.
Pubblicazione: (2024)
di: Lin, Wei, et al.
Pubblicazione: (2024)
TTRV: Test-Time Reinforcement Learning for Vision Language Models
di: Singh, Akshit, et al.
Pubblicazione: (2025)
di: Singh, Akshit, et al.
Pubblicazione: (2025)
PRISMM-Bench: A Benchmark of Peer-Review Grounded Multimodal Inconsistencies
di: Selch, Lukas, et al.
Pubblicazione: (2025)
di: Selch, Lukas, et al.
Pubblicazione: (2025)
Meta-Prompting for Automating Zero-shot Visual Recognition with LLMs
di: Mirza, M. Jehanzeb, et al.
Pubblicazione: (2024)
di: Mirza, M. Jehanzeb, et al.
Pubblicazione: (2024)
Towards Multimodal In-Context Learning for Vision & Language Models
di: Doveh, Sivan, et al.
Pubblicazione: (2024)
di: Doveh, Sivan, et al.
Pubblicazione: (2024)
DeepResonance: Enhancing Multimodal Music Understanding via Music-centric Multi-way Instruction Tuning
di: Mao, Zhuoyuan, et al.
Pubblicazione: (2025)
di: Mao, Zhuoyuan, et al.
Pubblicazione: (2025)
Teaching VLMs to Localize Specific Objects from In-context Examples
di: Doveh, Sivan, et al.
Pubblicazione: (2024)
di: Doveh, Sivan, et al.
Pubblicazione: (2024)
State-Space Large Audio Language Models
di: Bhati, Saurabhchand, et al.
Pubblicazione: (2024)
di: Bhati, Saurabhchand, et al.
Pubblicazione: (2024)
Exploring Modality Guidance to Enhance VFM-based Feature Fusion for UDA in 3D Semantic Segmentation
di: Spoecklberger, Johannes, et al.
Pubblicazione: (2025)
di: Spoecklberger, Johannes, et al.
Pubblicazione: (2025)
CALM: Class-Conditional Sparse Attention Vectors for Large Audio-Language Models
di: Mehta, Videet, et al.
Pubblicazione: (2026)
di: Mehta, Videet, et al.
Pubblicazione: (2026)
Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion
di: Hansen, Jacob, et al.
Pubblicazione: (2025)
di: Hansen, Jacob, et al.
Pubblicazione: (2025)
Mining Your Own Secrets: Diffusion Classifier Scores for Continual Personalization of Text-to-Image Diffusion Models
di: Jha, Saurav, et al.
Pubblicazione: (2024)
di: Jha, Saurav, et al.
Pubblicazione: (2024)
OpenMU: Your Swiss Army Knife for Music Understanding
di: Zhao, Mengjie, et al.
Pubblicazione: (2024)
di: Zhao, Mengjie, et al.
Pubblicazione: (2024)
DASS: Distilled Audio State Space Models Are Stronger and More Duration-Scalable Learners
di: Bhati, Saurabhchand, et al.
Pubblicazione: (2024)
di: Bhati, Saurabhchand, et al.
Pubblicazione: (2024)
Probing the effectiveness of World Models for Spatial Reasoning through Test-time Scaling
di: Jha, Saurav, et al.
Pubblicazione: (2025)
di: Jha, Saurav, et al.
Pubblicazione: (2025)
Cross-Modal Learning for Music-to-Music-Video Description Generation
di: Mao, Zhuoyuan, et al.
Pubblicazione: (2025)
di: Mao, Zhuoyuan, et al.
Pubblicazione: (2025)
VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes
di: Gavrikov, Paul, et al.
Pubblicazione: (2025)
di: Gavrikov, Paul, et al.
Pubblicazione: (2025)
Learning to Route Languages for Multilingual Policy Optimization
di: Guo, Geyang, et al.
Pubblicazione: (2026)
di: Guo, Geyang, et al.
Pubblicazione: (2026)
Self-Specialization: Uncovering Latent Expertise within Large Language Models
di: Kang, Junmo, et al.
Pubblicazione: (2023)
di: Kang, Junmo, et al.
Pubblicazione: (2023)
Latent Implicit Visual Reasoning
di: Li, Kelvin, et al.
Pubblicazione: (2025)
di: Li, Kelvin, et al.
Pubblicazione: (2025)
CAMELoT: Towards Large Language Models with Training-Free Consolidated Associative Memory
di: He, Zexue, et al.
Pubblicazione: (2024)
di: He, Zexue, et al.
Pubblicazione: (2024)
ConMe: Rethinking Evaluation of Compositional Reasoning for Modern VLMs
di: Huang, Irene, et al.
Pubblicazione: (2024)
di: Huang, Irene, et al.
Pubblicazione: (2024)
DiffuCOMET: Contextual Commonsense Knowledge Diffusion
di: Gao, Silin, et al.
Pubblicazione: (2024)
di: Gao, Silin, et al.
Pubblicazione: (2024)
MAEDAY: MAE for few and zero shot AnomalY-Detection
di: Schwartz, Eli, et al.
Pubblicazione: (2022)
di: Schwartz, Eli, et al.
Pubblicazione: (2022)
Self-MoE: Towards Compositional Large Language Models with Self-Specialized Experts
di: Kang, Junmo, et al.
Pubblicazione: (2024)
di: Kang, Junmo, et al.
Pubblicazione: (2024)
NumeroLogic: Number Encoding for Enhanced LLMs' Numerical Reasoning
di: Schwartz, Eli, et al.
Pubblicazione: (2024)
di: Schwartz, Eli, et al.
Pubblicazione: (2024)
Whisper-Flamingo: Integrating Visual Features into Whisper for Audio-Visual Speech Recognition and Translation
di: Rouditchenko, Andrew, et al.
Pubblicazione: (2024)
di: Rouditchenko, Andrew, et al.
Pubblicazione: (2024)
LiveXiv -- A Multi-Modal Live Benchmark Based on Arxiv Papers Content
di: Shabtay, Nimrod, et al.
Pubblicazione: (2024)
di: Shabtay, Nimrod, et al.
Pubblicazione: (2024)
Overflow Prevention Enhances Long-Context Recurrent LLMs
di: Ben-Kish, Assaf, et al.
Pubblicazione: (2025)
di: Ben-Kish, Assaf, et al.
Pubblicazione: (2025)
Towards Audio Token Compression in Large Audio Language Models
di: Bhati, Saurabhchand, et al.
Pubblicazione: (2025)
di: Bhati, Saurabhchand, et al.
Pubblicazione: (2025)
Navigating the Labyrinth: Evaluating LLMs' Ability to Reason About Search Problems
di: Borazjanizadeh, Nasim, et al.
Pubblicazione: (2024)
di: Borazjanizadeh, Nasim, et al.
Pubblicazione: (2024)
Into the Fog: Evaluating Robustness of Multiple Object Tracking
di: Kirillova, Nadezda, et al.
Pubblicazione: (2024)
di: Kirillova, Nadezda, et al.
Pubblicazione: (2024)
Demystifying MaskGIT Sampler and Beyond: Adaptive Order Selection in Masked Diffusion
di: Hayakawa, Satoshi, et al.
Pubblicazione: (2025)
di: Hayakawa, Satoshi, et al.
Pubblicazione: (2025)
Distillation of Discrete Diffusion through Dimensional Correlations
di: Hayakawa, Satoshi, et al.
Pubblicazione: (2024)
di: Hayakawa, Satoshi, et al.
Pubblicazione: (2024)
$\texttt{BATCLIP}$: Bimodal Online Test-Time Adaptation for CLIP
di: Maharana, Sarthak Kumar, et al.
Pubblicazione: (2024)
di: Maharana, Sarthak Kumar, et al.
Pubblicazione: (2024)
KV Cache Steering for Controlling Frozen LLMs
di: Belitsky, Max, et al.
Pubblicazione: (2025)
di: Belitsky, Max, et al.
Pubblicazione: (2025)
AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers
di: Araujo, Edson, et al.
Pubblicazione: (2026)
di: Araujo, Edson, et al.
Pubblicazione: (2026)
ComperDial: Commonsense Persona-grounded Dialogue Dataset and Benchmark
di: Wakaki, Hiromi, et al.
Pubblicazione: (2024)
di: Wakaki, Hiromi, et al.
Pubblicazione: (2024)
Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features
di: Mitra, Chancharik, et al.
Pubblicazione: (2024)
di: Mitra, Chancharik, et al.
Pubblicazione: (2024)
Visualizing Thought: Conceptual Diagrams Enable Robust Planning in LMMs
di: Borazjanizadeh, Nasim, et al.
Pubblicazione: (2025)
di: Borazjanizadeh, Nasim, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Comparison Visual Instruction Tuning
di: Lin, Wei, et al.
Pubblicazione: (2024) -
TTRV: Test-Time Reinforcement Learning for Vision Language Models
di: Singh, Akshit, et al.
Pubblicazione: (2025) -
PRISMM-Bench: A Benchmark of Peer-Review Grounded Multimodal Inconsistencies
di: Selch, Lukas, et al.
Pubblicazione: (2025) -
Meta-Prompting for Automating Zero-shot Visual Recognition with LLMs
di: Mirza, M. Jehanzeb, et al.
Pubblicazione: (2024) -
Towards Multimodal In-Context Learning for Vision & Language Models
di: Doveh, Sivan, et al.
Pubblicazione: (2024)