RLLaVA: An RL-central Framework for Language and Vision Assistants
Fuente:
arXiv
Saved in:
| Main Authors: | Zhao, Lei, Ma, Zihao, Lin, Boyu, Liu, Yuhe, Wu, Wenjun, Huang, Lei |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Yo'LLaVA: Your Personalized Language and Vision Assistant
by: Nguyen, Thao, et al.
Published: (2024)
by: Nguyen, Thao, et al.
Published: (2024)
Parallel Layer Normalization for Universal Approximation
by: Ni, Yunhao, et al.
Published: (2025)
by: Ni, Yunhao, et al.
Published: (2025)
SLaVA-CXR: Small Language and Vision Assistant for Chest X-ray Report Automation
by: Wu, Jinge, et al.
Published: (2024)
by: Wu, Jinge, et al.
Published: (2024)
Theoretical Analysis of Inductive Biases in Deep Convolutional Networks
by: Wang, Zihao, et al.
Published: (2023)
by: Wang, Zihao, et al.
Published: (2023)
SQ-LLaVA: Self-Questioning for Large Vision-Language Assistant
by: Sun, Guohao, et al.
Published: (2024)
by: Sun, Guohao, et al.
Published: (2024)
$π_\texttt{RL}$: Online RL Fine-tuning for Flow-based Vision-Language-Action Models
by: Chen, Kang, et al.
Published: (2025)
by: Chen, Kang, et al.
Published: (2025)
STLLaVA-Med: Self-Training Large Language and Vision Assistant for Medical Question-Answering
by: Sun, Guohao, et al.
Published: (2024)
by: Sun, Guohao, et al.
Published: (2024)
TinyLLaVA: A Framework of Small-scale Large Multimodal Models
by: Zhou, Baichuan, et al.
Published: (2024)
by: Zhou, Baichuan, et al.
Published: (2024)
An Investigation of Batch Normalization in Off-Policy Actor-Critic Algorithms
by: Wang, Li, et al.
Published: (2025)
by: Wang, Li, et al.
Published: (2025)
AcceRL: A Distributed Asynchronous Reinforcement Learning and World Model Framework for Vision-Language-Action Models
by: Lu, Chengxuan, et al.
Published: (2026)
by: Lu, Chengxuan, et al.
Published: (2026)
RL Token: Bootstrapping Online RL with Vision-Language-Action Models
by: Xu, Charles, et al.
Published: (2026)
by: Xu, Charles, et al.
Published: (2026)
Boundary-Guided Policy Optimization for Memory-efficient RL of Diffusion Large Language Models
by: Lin, Nianyi, et al.
Published: (2025)
by: Lin, Nianyi, et al.
Published: (2025)
Rethinking RL Scaling for Vision Language Models: A Transparent, From-Scratch Framework and Comprehensive Evaluation Scheme
by: Ma, Yan, et al.
Published: (2025)
by: Ma, Yan, et al.
Published: (2025)
Fight Fire with Fire: Defending Against Malicious RL Fine-Tuning via Reward Neutralization
by: Cao, Wenjun
Published: (2025)
by: Cao, Wenjun
Published: (2025)
Bridging Vision, Language, and Mathematics: Pictographic Character Reconstruction with Bézier Curves
by: Wan, Zihao, et al.
Published: (2025)
by: Wan, Zihao, et al.
Published: (2025)
Data Augmentation for Continual RL via Adversarial Gradient Episodic Memory
by: Wu, Sihao, et al.
Published: (2024)
by: Wu, Sihao, et al.
Published: (2024)
Reducing Oracle Feedback with Vision-Language Embeddings for Preference-Based RL
by: Ghosh, Udita, et al.
Published: (2026)
by: Ghosh, Udita, et al.
Published: (2026)
DiRL: An Efficient Post-Training Framework for Diffusion Language Models
by: Zhu, Ying, et al.
Published: (2025)
by: Zhu, Ying, et al.
Published: (2025)
Risk-Sensitive RL for Alleviating Exploration Dilemmas in Large Language Models
by: Jiang, Yuhua, et al.
Published: (2025)
by: Jiang, Yuhua, et al.
Published: (2025)
Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks
by: Ding, Yuhe, et al.
Published: (2024)
by: Ding, Yuhe, et al.
Published: (2024)
Anti-Self-Distillation for Reasoning RL via Pointwise Mutual Information
by: Shen, Guobin, et al.
Published: (2026)
by: Shen, Guobin, et al.
Published: (2026)
Traffic expertise meets residual RL: Knowledge-informed model-based residual reinforcement learning for CAV trajectory control
by: Sheng, Zihao, et al.
Published: (2024)
by: Sheng, Zihao, et al.
Published: (2024)
FLAC: Maximum Entropy RL via Kinetic Energy Regularized Bridge Matching
by: Lv, Lei, et al.
Published: (2026)
by: Lv, Lei, et al.
Published: (2026)
The Local Landscape of Phase Retrieval Under Limited Samples
by: Liu, Kaizhao, et al.
Published: (2023)
by: Liu, Kaizhao, et al.
Published: (2023)
ChipLingo: A Systematic Training Framework for Large Language Models in EDA
by: Li, Lei, et al.
Published: (2026)
by: Li, Lei, et al.
Published: (2026)
QaRL: Rollout-Aligned Quantization-Aware RL for Fast and Stable Training under Training--Inference Mismatch
by: Gu, Hao, et al.
Published: (2026)
by: Gu, Hao, et al.
Published: (2026)
LLaGA: Large Language and Graph Assistant
by: Chen, Runjin, et al.
Published: (2024)
by: Chen, Runjin, et al.
Published: (2024)
FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning
by: Zhang, Xikai, et al.
Published: (2026)
by: Zhang, Xikai, et al.
Published: (2026)
TinyLLaVA Factory: A Modularized Codebase for Small-scale Large Multimodal Models
by: Jia, Junlong, et al.
Published: (2024)
by: Jia, Junlong, et al.
Published: (2024)
Enjoy Your Layer Normalization with the Computational Efficiency of RMSNorm
by: Guo, Yuxin, et al.
Published: (2026)
by: Guo, Yuxin, et al.
Published: (2026)
QHyer: Q-conditioned Hybrid Attention-mamba Transformer for Offline Goal-conditioned RL
by: Lei, Xing, et al.
Published: (2026)
by: Lei, Xing, et al.
Published: (2026)
ToolSample: Dual Dynamic Sampling Methods with Curriculum Learning for RL-based Tool Learning
by: Feng, Zihao, et al.
Published: (2025)
by: Feng, Zihao, et al.
Published: (2025)
DPGAN: A Dual-Path Generative Adversarial Network for Missing Data Imputation in Graphs
by: Zheng, Xindi, et al.
Published: (2024)
by: Zheng, Xindi, et al.
Published: (2024)
Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood
by: Yao, Qingmao, et al.
Published: (2025)
by: Yao, Qingmao, et al.
Published: (2025)
HSA-Net: Hierarchical and Structure-Aware Framework for Efficient and Scalable Molecular Language Modeling
by: Shao, Zihang, et al.
Published: (2025)
by: Shao, Zihang, et al.
Published: (2025)
LLaSA: Large Language and Structured Data Assistant
by: Xu, Yao, et al.
Published: (2024)
by: Xu, Yao, et al.
Published: (2024)
Q-WSL: Optimizing Goal-Conditioned RL with Weighted Supervised Learning via Dynamic Programming
by: Lei, Xing, et al.
Published: (2024)
by: Lei, Xing, et al.
Published: (2024)
QuantVLA: Scale-Calibrated Post-Training Quantization for Vision-Language-Action Models
by: Zhang, Jingxuan, et al.
Published: (2026)
by: Zhang, Jingxuan, et al.
Published: (2026)
Robust and Efficient Deep Hedging via Linearized Objective Neural Network
by: Zhao, Lei, et al.
Published: (2025)
by: Zhao, Lei, et al.
Published: (2025)
A Semantic Partitioning Method for Large-Scale Training of Knowledge Graph Embeddings
by: Bai, Yuhe
Published: (2025)
by: Bai, Yuhe
Published: (2025)
Similar Items
-
Yo'LLaVA: Your Personalized Language and Vision Assistant
by: Nguyen, Thao, et al.
Published: (2024) -
Parallel Layer Normalization for Universal Approximation
by: Ni, Yunhao, et al.
Published: (2025) -
SLaVA-CXR: Small Language and Vision Assistant for Chest X-ray Report Automation
by: Wu, Jinge, et al.
Published: (2024) -
Theoretical Analysis of Inductive Biases in Deep Convolutional Networks
by: Wang, Zihao, et al.
Published: (2023) -
SQ-LLaVA: Self-Questioning for Large Vision-Language Assistant
by: Sun, Guohao, et al.
Published: (2024)