Learning Self-Correction in Vision-Language Models via Rollout Augmentation
Fuente:
arXiv
Guardado en:
| Autores principales: | Ding, Yi, Qiu, Ziliang, Li, Bolian, Zhang, Ruqi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ETA: Evaluating Then Aligning Safety of Vision Language Models at Inference Time
por: Ding, Yi, et al.
Publicado: (2024)
por: Ding, Yi, et al.
Publicado: (2024)
Sherlock: Self-Correcting Reasoning in Vision-Language Models
por: Ding, Yi, et al.
Publicado: (2025)
por: Ding, Yi, et al.
Publicado: (2025)
VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models
por: Liao, Qilin, et al.
Publicado: (2025)
por: Liao, Qilin, et al.
Publicado: (2025)
Calibrated Self-Rewarding Vision Language Models
por: Zhou, Yiyang, et al.
Publicado: (2024)
por: Zhou, Yiyang, et al.
Publicado: (2024)
Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity
por: Lochab, Anamika, et al.
Publicado: (2026)
por: Lochab, Anamika, et al.
Publicado: (2026)
Vision-Language Models Can Self-Improve Reasoning via Reflection
por: Cheng, Kanzhi, et al.
Publicado: (2024)
por: Cheng, Kanzhi, et al.
Publicado: (2024)
Deep Augmentation: Dropout as Augmentation for Self-Supervised Learning
por: Brüel-Gabrielsson, Rickard, et al.
Publicado: (2023)
por: Brüel-Gabrielsson, Rickard, et al.
Publicado: (2023)
MMIE: Massive Multimodal Interleaved Comprehension Benchmark for Large Vision-Language Models
por: Xia, Peng, et al.
Publicado: (2024)
por: Xia, Peng, et al.
Publicado: (2024)
Matryoshka Query Transformer for Large Vision-Language Models
por: Hu, Wenbo, et al.
Publicado: (2024)
por: Hu, Wenbo, et al.
Publicado: (2024)
Unified Vision-Language Modeling via Concept Space Alignment
por: Qiu, Yifu, et al.
Publicado: (2026)
por: Qiu, Yifu, et al.
Publicado: (2026)
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning
por: Yang, Senqiao, et al.
Publicado: (2025)
por: Yang, Senqiao, et al.
Publicado: (2025)
MASSV: Multimodal Adaptation and Self-Data Distillation for Speculative Decoding of Vision-Language Models
por: Ganesan, Mugilan, et al.
Publicado: (2025)
por: Ganesan, Mugilan, et al.
Publicado: (2025)
Towards Statistical Factuality Guarantee for Large Vision-Language Models
por: Li, Zhuohang, et al.
Publicado: (2025)
por: Li, Zhuohang, et al.
Publicado: (2025)
Hierarchical Safety Realignment: Lightweight Restoration of Safety in Pruned Large Vision-Language Models
por: Li, Yue, et al.
Publicado: (2025)
por: Li, Yue, et al.
Publicado: (2025)
The Neglected Tails in Vision-Language Models
por: Parashar, Shubham, et al.
Publicado: (2024)
por: Parashar, Shubham, et al.
Publicado: (2024)
Efficient Vision-Language Reasoning via Adaptive Token Pruning
por: Li, Xue, et al.
Publicado: (2025)
por: Li, Xue, et al.
Publicado: (2025)
Rethinking Misalignment in Vision-Language Model Adaptation from a Causal Perspective
por: Zhang, Yanan, et al.
Publicado: (2024)
por: Zhang, Yanan, et al.
Publicado: (2024)
Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models
por: Dumpala, Sri Harsha, et al.
Publicado: (2024)
por: Dumpala, Sri Harsha, et al.
Publicado: (2024)
LaMI: Augmenting Large Language Models via Late Multi-Image Fusion
por: Yariv, Guy, et al.
Publicado: (2024)
por: Yariv, Guy, et al.
Publicado: (2024)
SharpZO: Hybrid Sharpness-Aware Vision Language Model Prompt Tuning via Forward-Only Passes
por: Yang, Yifan, et al.
Publicado: (2025)
por: Yang, Yifan, et al.
Publicado: (2025)
Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-Improvement
por: Wang, Xiyao, et al.
Publicado: (2024)
por: Wang, Xiyao, et al.
Publicado: (2024)
Aligning Modalities in Vision Large Language Models via Preference Fine-tuning
por: Zhou, Yiyang, et al.
Publicado: (2024)
por: Zhou, Yiyang, et al.
Publicado: (2024)
MoPD: Mixture-of-Prompts Distillation for Vision-Language Models
por: Chen, Yang, et al.
Publicado: (2024)
por: Chen, Yang, et al.
Publicado: (2024)
Towards Efficient Vision-Language Tuning: More Information Density, More Generalizability
por: Hao, Tianxiang, et al.
Publicado: (2023)
por: Hao, Tianxiang, et al.
Publicado: (2023)
TopViewRS: Vision-Language Models as Top-View Spatial Reasoners
por: Li, Chengzu, et al.
Publicado: (2024)
por: Li, Chengzu, et al.
Publicado: (2024)
DRESS: Instructing Large Vision-Language Models to Align and Interact with Humans via Natural Language Feedback
por: Chen, Yangyi, et al.
Publicado: (2023)
por: Chen, Yangyi, et al.
Publicado: (2023)
Mixture of Experts Made Personalized: Federated Prompt Learning for Vision-Language Models
por: Luo, Jun, et al.
Publicado: (2024)
por: Luo, Jun, et al.
Publicado: (2024)
Federated Learning from Vision-Language Foundation Models: Theoretical Analysis and Method
por: Pan, Bikang, et al.
Publicado: (2024)
por: Pan, Bikang, et al.
Publicado: (2024)
A Survey on Hallucination in Large Vision-Language Models
por: Liu, Hanchao, et al.
Publicado: (2024)
por: Liu, Hanchao, et al.
Publicado: (2024)
Q-GroundCAM: Quantifying Grounding in Vision Language Models via GradCAM
por: Rajabi, Navid, et al.
Publicado: (2024)
por: Rajabi, Navid, et al.
Publicado: (2024)
DELAN: Dual-Level Alignment for Vision-and-Language Navigation by Cross-Modal Contrastive Learning
por: Du, Mengfei, et al.
Publicado: (2024)
por: Du, Mengfei, et al.
Publicado: (2024)
VisPlay: Self-Evolving Vision-Language Models from Images
por: He, Yicheng, et al.
Publicado: (2025)
por: He, Yicheng, et al.
Publicado: (2025)
Rephrase, Augment, Reason: Visual Grounding of Questions for Vision-Language Models
por: Prasad, Archiki, et al.
Publicado: (2023)
por: Prasad, Archiki, et al.
Publicado: (2023)
MMed-RAG: Versatile Multimodal RAG System for Medical Vision Language Models
por: Xia, Peng, et al.
Publicado: (2024)
por: Xia, Peng, et al.
Publicado: (2024)
When are Lemons Purple? The Concept Association Bias of Vision-Language Models
por: Yamada, Yutaro, et al.
Publicado: (2022)
por: Yamada, Yutaro, et al.
Publicado: (2022)
Analyzing and Mitigating Object Hallucination in Large Vision-Language Models
por: Zhou, Yiyang, et al.
Publicado: (2023)
por: Zhou, Yiyang, et al.
Publicado: (2023)
Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models
por: Yi, Hao, et al.
Publicado: (2024)
por: Yi, Hao, et al.
Publicado: (2024)
Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning
por: Zhai, Yuexiang, et al.
Publicado: (2024)
por: Zhai, Yuexiang, et al.
Publicado: (2024)
TLDR: Token-Level Detective Reward Model for Large Vision Language Models
por: Fu, Deqing, et al.
Publicado: (2024)
por: Fu, Deqing, et al.
Publicado: (2024)
A Vision Check-up for Language Models
por: Sharma, Pratyusha, et al.
Publicado: (2024)
por: Sharma, Pratyusha, et al.
Publicado: (2024)
Ejemplares similares
-
ETA: Evaluating Then Aligning Safety of Vision Language Models at Inference Time
por: Ding, Yi, et al.
Publicado: (2024) -
Sherlock: Self-Correcting Reasoning in Vision-Language Models
por: Ding, Yi, et al.
Publicado: (2025) -
VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models
por: Liao, Qilin, et al.
Publicado: (2025) -
Calibrated Self-Rewarding Vision Language Models
por: Zhou, Yiyang, et al.
Publicado: (2024) -
Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity
por: Lochab, Anamika, et al.
Publicado: (2026)