Wiki-LLaVA: Hierarchical Retrieval-Augmented Generation for Multimodal LLMs
Fuente:
arXiv
Guardado en:
| Autores principales: | Caffagni, Davide, Cocchi, Federico, Moratelli, Nicholas, Sarto, Sara, Cornia, Marcella, Baraldi, Lorenzo, Cucchiara, Rita |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LLaVA-MORE: A Comparative Study of LLMs and Visual Backbones for Enhanced Visual Instruction Tuning
por: Cocchi, Federico, et al.
Publicado: (2025)
por: Cocchi, Federico, et al.
Publicado: (2025)
Augmenting Multimodal LLMs with Self-Reflective Tokens for Knowledge-based Visual Question Answering
por: Cocchi, Federico, et al.
Publicado: (2024)
por: Cocchi, Federico, et al.
Publicado: (2024)
Recurrence Meets Transformers for Universal Multimodal Retrieval
por: Caffagni, Davide, et al.
Publicado: (2025)
por: Caffagni, Davide, et al.
Publicado: (2025)
The Revolution of Multimodal Large Language Models: A Survey
por: Caffagni, Davide, et al.
Publicado: (2024)
por: Caffagni, Davide, et al.
Publicado: (2024)
Recurrence-Enhanced Vision-and-Language Transformers for Robust Multimodal Document Retrieval
por: Caffagni, Davide, et al.
Publicado: (2025)
por: Caffagni, Davide, et al.
Publicado: (2025)
Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization
por: Compagnoni, Alberto, et al.
Publicado: (2025)
por: Compagnoni, Alberto, et al.
Publicado: (2025)
Positive-Augmented Contrastive Learning for Vision-and-Language Evaluation and Training
por: Sarto, Sara, et al.
Publicado: (2024)
por: Sarto, Sara, et al.
Publicado: (2024)
Revisiting Image Captioning Training Paradigm via Direct CLIP-based Optimization
por: Moratelli, Nicholas, et al.
Publicado: (2024)
por: Moratelli, Nicholas, et al.
Publicado: (2024)
ReAG: Reasoning-Augmented Generation for Knowledge-based Visual Question Answering
por: Compagnoni, Alberto, et al.
Publicado: (2025)
por: Compagnoni, Alberto, et al.
Publicado: (2025)
Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis
por: Bucciarelli, Davide, et al.
Publicado: (2024)
por: Bucciarelli, Davide, et al.
Publicado: (2024)
Towards Retrieval-Augmented Architectures for Image Captioning
por: Sarto, Sara, et al.
Publicado: (2024)
por: Sarto, Sara, et al.
Publicado: (2024)
BRIDGE: Bridging Gaps in Image Captioning Evaluation with Stronger Visual Cues
por: Sarto, Sara, et al.
Publicado: (2024)
por: Sarto, Sara, et al.
Publicado: (2024)
RaTA-Tool: Retrieval-based Tool Selection with Multimodal Large Language Models
por: Mattioli, Gabriele, et al.
Publicado: (2026)
por: Mattioli, Gabriele, et al.
Publicado: (2026)
Contrasting Deepfakes Diffusion via Contrastive Learning and Global-Local Similarities
por: Baraldi, Lorenzo, et al.
Publicado: (2024)
por: Baraldi, Lorenzo, et al.
Publicado: (2024)
Seeing Beyond Words: Self-Supervised Visual Learning for Multimodal Large Language Models
por: Caffagni, Davide, et al.
Publicado: (2025)
por: Caffagni, Davide, et al.
Publicado: (2025)
Safe-CLIP: Removing NSFW Concepts from Vision-and-Language Models
por: Poppi, Samuele, et al.
Publicado: (2023)
por: Poppi, Samuele, et al.
Publicado: (2023)
What Changed? Detecting and Evaluating Instruction-Guided Image Edits with Multimodal Large Language Models
por: Baraldi, Lorenzo, et al.
Publicado: (2025)
por: Baraldi, Lorenzo, et al.
Publicado: (2025)
Fashion-RAG: Multimodal Fashion Image Editing via Retrieval-Augmented Generation
por: Sanguigni, Fulvio, et al.
Publicado: (2025)
por: Sanguigni, Fulvio, et al.
Publicado: (2025)
Tiny Inference-Time Scaling with Latent Verifiers
por: Bucciarelli, Davide, et al.
Publicado: (2026)
por: Bucciarelli, Davide, et al.
Publicado: (2026)
Few Channels Draw The Whole Picture: Revealing Massive Activations in Diffusion Transformers
por: Turri, Evelyn, et al.
Publicado: (2026)
por: Turri, Evelyn, et al.
Publicado: (2026)
Parents and Children: Distinguishing Multimodal DeepFakes from Natural Images
por: Amoroso, Roberto, et al.
Publicado: (2023)
por: Amoroso, Roberto, et al.
Publicado: (2023)
Learning to Mask and Permute Visual Tokens for Vision Transformer Pre-Training
por: Baraldi, Lorenzo, et al.
Publicado: (2023)
por: Baraldi, Lorenzo, et al.
Publicado: (2023)
Fluent and Accurate Image Captioning with a Self-Trained Reward Model
por: Moratelli, Nicholas, et al.
Publicado: (2024)
por: Moratelli, Nicholas, et al.
Publicado: (2024)
Causal Graphical Models for Vision-Language Compositional Understanding
por: Parascandolo, Fiorenzo, et al.
Publicado: (2024)
por: Parascandolo, Fiorenzo, et al.
Publicado: (2024)
Image Captioning Evaluation in the Age of Multimodal LLMs: Challenges and Future Perspectives
por: Sarto, Sara, et al.
Publicado: (2025)
por: Sarto, Sara, et al.
Publicado: (2025)
Multi-Class Unlearning for Image Classification via Weight Filtering
por: Poppi, Samuele, et al.
Publicado: (2023)
por: Poppi, Samuele, et al.
Publicado: (2023)
LLaVA-NeuMT: Selective Layer-Neuron Modulation for Efficient Multilingual Multimodal Translation
por: Wei, Jingxuan, et al.
Publicado: (2025)
por: Wei, Jingxuan, et al.
Publicado: (2025)
CounterVid: Counterfactual Video Generation for Mitigating Action and Temporal Hallucinations in Video-Language Models
por: Poppi, Tobia, et al.
Publicado: (2026)
por: Poppi, Tobia, et al.
Publicado: (2026)
Look Twice: Training-Free Evidence Highlighting in Multimodal Large Language Models
por: Morini, Marco, et al.
Publicado: (2026)
por: Morini, Marco, et al.
Publicado: (2026)
LLaVA-Scissor: Token Compression with Semantic Connected Components for Video LLMs
por: Sun, Boyuan, et al.
Publicado: (2025)
por: Sun, Boyuan, et al.
Publicado: (2025)
Hyperbolic Safety-Aware Vision-Language Models
por: Poppi, Tobia, et al.
Publicado: (2025)
por: Poppi, Tobia, et al.
Publicado: (2025)
Training-Free Open-Vocabulary Segmentation with Offline Diffusion-Augmented Prototype Generation
por: Barsellotti, Luca, et al.
Publicado: (2024)
por: Barsellotti, Luca, et al.
Publicado: (2024)
Embodied Agents for Efficient Exploration and Smart Scene Description
por: Bigazzi, Roberto, et al.
Publicado: (2023)
por: Bigazzi, Roberto, et al.
Publicado: (2023)
Explore and Explain: Self-supervised Navigation and Recounting
por: Bigazzi, Roberto, et al.
Publicado: (2020)
por: Bigazzi, Roberto, et al.
Publicado: (2020)
Personalized Instance-based Navigation Toward User-Specific Objects in Realistic Environments
por: Barsellotti, Luca, et al.
Publicado: (2024)
por: Barsellotti, Luca, et al.
Publicado: (2024)
Harnessing Self-Supervised Features for Art Classification
por: Melis, Federico, et al.
Publicado: (2026)
por: Melis, Federico, et al.
Publicado: (2026)
Spot the Difference: A Novel Task for Embodied Agents in Changing Environments
por: Landi, Federico, et al.
Publicado: (2022)
por: Landi, Federico, et al.
Publicado: (2022)
Embodied Navigation at the Art Gallery
por: Bigazzi, Roberto, et al.
Publicado: (2022)
por: Bigazzi, Roberto, et al.
Publicado: (2022)
Retrieval-Augmented Multimodal Model for Fake News Detection
por: Li, Yiheng, et al.
Publicado: (2026)
por: Li, Yiheng, et al.
Publicado: (2026)
Can Sound Replace Vision in LLaVA With Token Substitution?
por: Vosoughi, Ali, et al.
Publicado: (2025)
por: Vosoughi, Ali, et al.
Publicado: (2025)
Ejemplares similares
-
LLaVA-MORE: A Comparative Study of LLMs and Visual Backbones for Enhanced Visual Instruction Tuning
por: Cocchi, Federico, et al.
Publicado: (2025) -
Augmenting Multimodal LLMs with Self-Reflective Tokens for Knowledge-based Visual Question Answering
por: Cocchi, Federico, et al.
Publicado: (2024) -
Recurrence Meets Transformers for Universal Multimodal Retrieval
por: Caffagni, Davide, et al.
Publicado: (2025) -
The Revolution of Multimodal Large Language Models: A Survey
por: Caffagni, Davide, et al.
Publicado: (2024) -
Recurrence-Enhanced Vision-and-Language Transformers for Robust Multimodal Document Retrieval
por: Caffagni, Davide, et al.
Publicado: (2025)