Fine-Tuning Next-Scale Visual Autoregressive Models with Group Relative Policy Optimization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Gallici, Matteo, Borde, Haitz Sáez de Ocáriz |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Structured Captions Improve Prompt Adherence in Text-to-Image Models (Re-LAION-Caption 19M)
par: Merchant, Nicholas, et autres
Publié: (2025)
par: Merchant, Nicholas, et autres
Publié: (2025)
LoRA Fine-Tuning Without GPUs: A CPU-Efficient Meta-Generation Framework for LLMs
par: Arabpour, Reza, et autres
Publié: (2025)
par: Arabpour, Reza, et autres
Publié: (2025)
Mathematical Foundations of Geometric Deep Learning
par: Borde, Haitz Sáez de Ocáriz, et autres
Publié: (2025)
par: Borde, Haitz Sáez de Ocáriz, et autres
Publié: (2025)
Metric Learning for Clifford Group Equivariant Neural Networks
par: Ali, Riccardo, et autres
Publié: (2024)
par: Ali, Riccardo, et autres
Publié: (2024)
k-Maximum Inner Product Attention for Graph Transformers and the Expressive Power of GraphGPS
par: De Schouwer, Jonas, et autres
Publié: (2026)
par: De Schouwer, Jonas, et autres
Publié: (2026)
Keep It Light! Simplifying Image Clustering Via Text-Free Adapters
par: Li, Yicen, et autres
Publié: (2025)
par: Li, Yicen, et autres
Publié: (2025)
Co-GRPO: Co-Optimized Group Relative Policy Optimization for Masked Diffusion Model
par: Zhou, Renping, et autres
Publié: (2025)
par: Zhou, Renping, et autres
Publié: (2025)
Beyond Parallelism: Synergistic Computational Graph Effects in Multi-Head Attention
par: Borde, Haitz Sáez de Ocáriz
Publié: (2025)
par: Borde, Haitz Sáez de Ocáriz
Publié: (2025)
Diversify, Don't Fine-Tune: Scaling Up Visual Recognition Training with Synthetic Images
par: Yu, Zhuoran, et autres
Publié: (2023)
par: Yu, Zhuoran, et autres
Publié: (2023)
Score Distillation via Reparametrized DDIM
par: Lukoianov, Artem, et autres
Publié: (2024)
par: Lukoianov, Artem, et autres
Publié: (2024)
PointNSP: Autoregressive 3D Point Cloud Generation with Next-Scale Level-of-Detail Prediction
par: Meng, Ziqiao, et autres
Publié: (2025)
par: Meng, Ziqiao, et autres
Publié: (2025)
Towards Quantifying Long-Range Interactions in Graph Machine Learning: a Large Graph Dataset and a Measurement
par: Liang, Huidong, et autres
Publié: (2025)
par: Liang, Huidong, et autres
Publié: (2025)
Half-order Fine-Tuning for Diffusion Model: A Recursive Likelihood Ratio Optimizer
par: Ren, Tao, et autres
Publié: (2025)
par: Ren, Tao, et autres
Publié: (2025)
Fine-Tuning is Fine, if Calibrated
par: Mai, Zheda, et autres
Publié: (2024)
par: Mai, Zheda, et autres
Publié: (2024)
Selective Mixup Fine-Tuning for Optimizing Non-Decomposable Objectives
par: Ramasubramanian, Shrinivas, et autres
Publié: (2024)
par: Ramasubramanian, Shrinivas, et autres
Publié: (2024)
Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success
par: Kim, Moo Jin, et autres
Publié: (2025)
par: Kim, Moo Jin, et autres
Publié: (2025)
Domain-Aware Fine-Tuning of Foundation Models
par: Kaplan, Ugur Ali, et autres
Publié: (2024)
par: Kaplan, Ugur Ali, et autres
Publié: (2024)
SpectralAR: Spectral Autoregressive Visual Generation
par: Huang, Yuanhui, et autres
Publié: (2025)
par: Huang, Yuanhui, et autres
Publié: (2025)
Sharp Generalization Bounds for Foundation Models with Asymmetric Randomized Low-Rank Adapters
par: Kratsios, Anastasis, et autres
Publié: (2025)
par: Kratsios, Anastasis, et autres
Publié: (2025)
Next Visual Granularity Generation
par: Wang, Yikai, et autres
Publié: (2025)
par: Wang, Yikai, et autres
Publié: (2025)
DriveGPT: Scaling Autoregressive Behavior Models for Driving
par: Huang, Xin, et autres
Publié: (2024)
par: Huang, Xin, et autres
Publié: (2024)
On Computational Limits and Provably Efficient Criteria of Visual Autoregressive Models: A Fine-Grained Complexity Analysis
par: Ke, Yekun, et autres
Publié: (2025)
par: Ke, Yekun, et autres
Publié: (2025)
VTBench: Evaluating Visual Tokenizers for Autoregressive Image Generation
par: Lin, Huawei, et autres
Publié: (2025)
par: Lin, Huawei, et autres
Publié: (2025)
HART: Efficient Visual Generation with Hybrid Autoregressive Transformer
par: Tang, Haotian, et autres
Publié: (2024)
par: Tang, Haotian, et autres
Publié: (2024)
Lessons and Insights from a Unifying Study of Parameter-Efficient Fine-Tuning (PEFT) in Visual Recognition
par: Mai, Zheda, et autres
Publié: (2024)
par: Mai, Zheda, et autres
Publié: (2024)
Gradient-based Fine-Tuning through Pre-trained Model Regularization
par: Liu, Xuanbo, et autres
Publié: (2025)
par: Liu, Xuanbo, et autres
Publié: (2025)
Chart Deep Research in LVLMs via Parallel Relative Policy Optimization
par: Tang, Jiajin, et autres
Publié: (2026)
par: Tang, Jiajin, et autres
Publié: (2026)
Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction
par: Tian, Keyu, et autres
Publié: (2024)
par: Tian, Keyu, et autres
Publié: (2024)
Fine-Tuning a Large Vision-Language Model for Artwork's Scoring and Critique
par: Zhang, Zhehan, et autres
Publié: (2026)
par: Zhang, Zhehan, et autres
Publié: (2026)
RoaD: Rollouts as Demonstrations for Closed-Loop Supervised Fine-Tuning of Autonomous Driving Policies
par: Garcia-Cobo, Guillermo, et autres
Publié: (2025)
par: Garcia-Cobo, Guillermo, et autres
Publié: (2025)
R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization
par: Zhang, Jingyi, et autres
Publié: (2025)
par: Zhang, Jingyi, et autres
Publié: (2025)
Taming the Entropy Cliff: Variable Codebook Size Quantization for Autoregressive Visual Generation
par: Zheng, Bowen, et autres
Publié: (2026)
par: Zheng, Bowen, et autres
Publié: (2026)
Visual Autoregressive Transformers Must Use $Ω(n^2 d)$ Memory
par: Cao, Yang, et autres
Publié: (2025)
par: Cao, Yang, et autres
Publié: (2025)
Point-PEFT: Parameter-Efficient Fine-Tuning for 3D Pre-trained Models
par: Tang, Yiwen, et autres
Publié: (2023)
par: Tang, Yiwen, et autres
Publié: (2023)
Chain-of-Zoom: Extreme Super-Resolution via Scale Autoregression and Preference Alignment
par: Kim, Bryan Sangwoo, et autres
Publié: (2025)
par: Kim, Bryan Sangwoo, et autres
Publié: (2025)
Unlocking Tuning-Free Few-Shot Adaptability in Visual Foundation Models by Recycling Pre-Tuned LoRAs
par: Hu, Zixuan, et autres
Publié: (2024)
par: Hu, Zixuan, et autres
Publié: (2024)
FOCUS: Forcing In-Context Object Localization through Visual Support Constraints and Policy Optimization
par: Karim, Mohammed Asad, et autres
Publié: (2026)
par: Karim, Mohammed Asad, et autres
Publié: (2026)
CLEFT: Language-Image Contrastive Learning with Efficient Large Language Model and Prompt Fine-Tuning
par: Du, Yuexi, et autres
Publié: (2024)
par: Du, Yuexi, et autres
Publié: (2024)
Relational Visual Similarity
par: Nguyen, Thao, et autres
Publié: (2025)
par: Nguyen, Thao, et autres
Publié: (2025)
Universal Approximation of Visual Autoregressive Transformers
par: Chen, Yifang, et autres
Publié: (2025)
par: Chen, Yifang, et autres
Publié: (2025)
Documents similaires
-
Structured Captions Improve Prompt Adherence in Text-to-Image Models (Re-LAION-Caption 19M)
par: Merchant, Nicholas, et autres
Publié: (2025) -
LoRA Fine-Tuning Without GPUs: A CPU-Efficient Meta-Generation Framework for LLMs
par: Arabpour, Reza, et autres
Publié: (2025) -
Mathematical Foundations of Geometric Deep Learning
par: Borde, Haitz Sáez de Ocáriz, et autres
Publié: (2025) -
Metric Learning for Clifford Group Equivariant Neural Networks
par: Ali, Riccardo, et autres
Publié: (2024) -
k-Maximum Inner Product Attention for Graph Transformers and the Expressive Power of GraphGPS
par: De Schouwer, Jonas, et autres
Publié: (2026)