VARGPT-v1.1: Improve Visual Autoregressive Large Unified Model via Iterative Instruction Tuning and Reinforcement Learning
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhuang, Xianwei, Xie, Yuxin, Deng, Yufan, Yang, Dongchao, Liang, Liming, Ru, Jinghan, Yin, Yuguo, Zou, Yuexian |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model
por: Zhuang, Xianwei, et al.
Publicado: (2025)
por: Zhuang, Xianwei, et al.
Publicado: (2025)
ATRI: Mitigating Multilingual Audio Text Retrieval Inconsistencies by Reducing Data Distribution Errors
por: Yin, Yuguo, et al.
Publicado: (2025)
por: Yin, Yuguo, et al.
Publicado: (2025)
Do we really have to filter out random noise in pre-training data for language models?
por: Ru, Jinghan, et al.
Publicado: (2025)
por: Ru, Jinghan, et al.
Publicado: (2025)
VASparse: Towards Efficient Visual Hallucination Mitigation via Visual-Aware Token Sparsification
por: Zhuang, Xianwei, et al.
Publicado: (2025)
por: Zhuang, Xianwei, et al.
Publicado: (2025)
SupCLAP: Controlling Optimization Trajectory Drift in Audio-Text Contrastive Learning with Support Vector Regularization
por: Luo, Jiehui, et al.
Publicado: (2025)
por: Luo, Jiehui, et al.
Publicado: (2025)
DermoGPT: Open Weights and Open Data for Morphology-Grounded Dermatological Reasoning MLLMs
por: Ru, Jinghan, et al.
Publicado: (2026)
por: Ru, Jinghan, et al.
Publicado: (2026)
Not All Tokens and Heads Are Equally Important: Dual-Level Attention Intervention for Hallucination Mitigation
por: Tang, Lexiang, et al.
Publicado: (2025)
por: Tang, Lexiang, et al.
Publicado: (2025)
ASK: Adaptive Self-improving Knowledge Framework for Audio Text Retrieval
por: Fu, Siyuan, et al.
Publicado: (2025)
por: Fu, Siyuan, et al.
Publicado: (2025)
HeartMuLa: A Family of Open Sourced Music Foundation Models
por: Yang, Dongchao, et al.
Publicado: (2026)
por: Yang, Dongchao, et al.
Publicado: (2026)
Improving Audio-Text Retrieval via Hierarchical Cross-Modal Interaction and Auxiliary Captions
por: Xin, Yifei, et al.
Publicado: (2023)
por: Xin, Yifei, et al.
Publicado: (2023)
CAR: Controllable Autoregressive Modeling for Visual Generation
por: Yao, Ziyu, et al.
Publicado: (2024)
por: Yao, Ziyu, et al.
Publicado: (2024)
Improved Baselines with Visual Instruction Tuning
por: Liu, Haotian, et al.
Publicado: (2023)
por: Liu, Haotian, et al.
Publicado: (2023)
RefChartQA: Grounding Visual Answer on Chart Images through Instruction Tuning
por: Vogel, Alexander, et al.
Publicado: (2025)
por: Vogel, Alexander, et al.
Publicado: (2025)
LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding
por: Zhang, Yanzhe, et al.
Publicado: (2023)
por: Zhang, Yanzhe, et al.
Publicado: (2023)
AFL-Net: Integrating Audio, Facial, and Lip Modalities with a Two-step Cross-attention for Robust Speaker Diarization in the Wild
por: Yin, Yongkang, et al.
Publicado: (2023)
por: Yin, Yongkang, et al.
Publicado: (2023)
LLaVA-c: Continual Improved Visual Instruction Tuning
por: Liu, Wenzhuo, et al.
Publicado: (2025)
por: Liu, Wenzhuo, et al.
Publicado: (2025)
Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness
por: Wang, Zeyu, et al.
Publicado: (2025)
por: Wang, Zeyu, et al.
Publicado: (2025)
A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation
por: Zhou, Shijie, et al.
Publicado: (2024)
por: Zhou, Shijie, et al.
Publicado: (2024)
Visual Autoregressive Modeling for Instruction-Guided Image Editing
por: Mao, Qingyang, et al.
Publicado: (2025)
por: Mao, Qingyang, et al.
Publicado: (2025)
Code Comparison Tuning for Code Large Language Models
por: Jiang, Yufan, et al.
Publicado: (2024)
por: Jiang, Yufan, et al.
Publicado: (2024)
Visual Agentic Reinforcement Fine-Tuning
por: Liu, Ziyu, et al.
Publicado: (2025)
por: Liu, Ziyu, et al.
Publicado: (2025)
PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering
por: Zhang, Xiaoman, et al.
Publicado: (2023)
por: Zhang, Xiaoman, et al.
Publicado: (2023)
Personalized Visual Instruction Tuning
por: Pi, Renjie, et al.
Publicado: (2024)
por: Pi, Renjie, et al.
Publicado: (2024)
Generative Visual Instruction Tuning
por: Hernandez, Jefferson, et al.
Publicado: (2024)
por: Hernandez, Jefferson, et al.
Publicado: (2024)
Comparison Visual Instruction Tuning
por: Lin, Wei, et al.
Publicado: (2024)
por: Lin, Wei, et al.
Publicado: (2024)
Visual Instruction Bottleneck Tuning
por: Oh, Changdae, et al.
Publicado: (2025)
por: Oh, Changdae, et al.
Publicado: (2025)
Reconstructive Visual Instruction Tuning
por: Wang, Haochen, et al.
Publicado: (2024)
por: Wang, Haochen, et al.
Publicado: (2024)
Near-Optimal Sample Complexity for Iterated CVaR Reinforcement Learning with a Generative Model
por: Deng, Zilong, et al.
Publicado: (2025)
por: Deng, Zilong, et al.
Publicado: (2025)
Seeing is Improving: Visual Feedback for Iterative Text Layout Refinement
por: Guo, Junrong, et al.
Publicado: (2026)
por: Guo, Junrong, et al.
Publicado: (2026)
YutingHe-list/TAMP: v1.0.0
por: Yuxin Liu
Publicado: (2026)
por: Yuxin Liu
Publicado: (2026)
RecycleGPT: An Autoregressive Language Model with Recyclable Module
por: Jiang, Yufan, et al.
Publicado: (2023)
por: Jiang, Yufan, et al.
Publicado: (2023)
On the Worst Prompt Performance of Large Language Models
por: Cao, Bowen, et al.
Publicado: (2024)
por: Cao, Bowen, et al.
Publicado: (2024)
Skywork UniPic: Unified Autoregressive Modeling for Visual Understanding and Generation
por: Wang, Peiyu, et al.
Publicado: (2025)
por: Wang, Peiyu, et al.
Publicado: (2025)
Unified Autoregressive Visual Generation and Understanding with Continuous Tokens
por: Fan, Lijie, et al.
Publicado: (2025)
por: Fan, Lijie, et al.
Publicado: (2025)
LEAD: Iterative Data Selection for Efficient LLM Instruction Tuning
por: Lin, Xiaotian, et al.
Publicado: (2025)
por: Lin, Xiaotian, et al.
Publicado: (2025)
Medical Image Understanding Improves Survival Prediction via Visual Instruction Tuning
por: Liu, Xixi, et al.
Publicado: (2026)
por: Liu, Xixi, et al.
Publicado: (2026)
Rethinking Table Instruction Tuning
por: Deng, Naihao, et al.
Publicado: (2025)
por: Deng, Naihao, et al.
Publicado: (2025)
A Unified Causal View of Instruction Tuning
por: Chen, Lu, et al.
Publicado: (2024)
por: Chen, Lu, et al.
Publicado: (2024)
What Makes for Good Visual Instructions? Synthesizing Complex Visual Reasoning Instructions for Visual Instruction Tuning
por: Du, Yifan, et al.
Publicado: (2023)
por: Du, Yifan, et al.
Publicado: (2023)
IterSelectTune: An Iterative Training Framework for Efficient Instruction-Tuning Data Selection
por: Song, Jielin, et al.
Publicado: (2024)
por: Song, Jielin, et al.
Publicado: (2024)
Ejemplares similares
-
VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model
por: Zhuang, Xianwei, et al.
Publicado: (2025) -
ATRI: Mitigating Multilingual Audio Text Retrieval Inconsistencies by Reducing Data Distribution Errors
por: Yin, Yuguo, et al.
Publicado: (2025) -
Do we really have to filter out random noise in pre-training data for language models?
por: Ru, Jinghan, et al.
Publicado: (2025) -
VASparse: Towards Efficient Visual Hallucination Mitigation via Visual-Aware Token Sparsification
por: Zhuang, Xianwei, et al.
Publicado: (2025) -
SupCLAP: Controlling Optimization Trajectory Drift in Audio-Text Contrastive Learning with Support Vector Regularization
por: Luo, Jiehui, et al.
Publicado: (2025)