A Comprehensive Survey of Data Augmentation in Visual Reinforcement Learning
Fuente:
arXiv
Saved in:
| Main Authors: | Ma, Guozheng, Wang, Zhen, Yuan, Zhecheng, Wang, Xueqian, Yuan, Bo, Tao, Dacheng |
|---|---|
| Format: | Preprint |
| Published: |
2022
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Learning to Manipulate Anywhere: A Visual Generalizable Framework For Reinforcement Learning
by: Yuan, Zhecheng, et al.
Published: (2024)
by: Yuan, Zhecheng, et al.
Published: (2024)
Learning to Learn from APIs: Black-Box Data-Free Meta-Learning
by: Hu, Zixuan, et al.
Published: (2023)
by: Hu, Zixuan, et al.
Published: (2023)
Architecture, Dataset and Model-Scale Agnostic Data-free Meta-Learning
by: Hu, Zixuan, et al.
Published: (2023)
by: Hu, Zixuan, et al.
Published: (2023)
Who Generated This 3D Asset? Learning Source Attribution for Generative 3D Models
by: Ma, Sihan, et al.
Published: (2026)
by: Ma, Sihan, et al.
Published: (2026)
VACoT: Rethinking Visual Data Augmentation with VLMs
by: Xu, Zhengzhuo, et al.
Published: (2025)
by: Xu, Zhengzhuo, et al.
Published: (2025)
Towards Open Vocabulary Learning: A Survey
by: Wu, Jianzong, et al.
Published: (2023)
by: Wu, Jianzong, et al.
Published: (2023)
ViTaS: Visual Tactile Soft Fusion Contrastive Learning for Visuomotor Learning
by: Tian, Yufeng, et al.
Published: (2026)
by: Tian, Yufeng, et al.
Published: (2026)
Semore: VLM-guided Enhanced Semantic Motion Representations for Visual Reinforcement Learning
by: Wang, Wentao, et al.
Published: (2025)
by: Wang, Wentao, et al.
Published: (2025)
Improving Medical Visual Reinforcement Fine-Tuning via Perception and Reasoning Augmentation
by: Yang, Guangjing, et al.
Published: (2026)
by: Yang, Guangjing, et al.
Published: (2026)
Unlocking Tuning-Free Few-Shot Adaptability in Visual Foundation Models by Recycling Pre-Tuned LoRAs
by: Hu, Zixuan, et al.
Published: (2024)
by: Hu, Zixuan, et al.
Published: (2024)
H$^3$DP: Triply-Hierarchical Diffusion Policy for Visuomotor Learning
by: Lu, Yiyang, et al.
Published: (2025)
by: Lu, Yiyang, et al.
Published: (2025)
RELO: Reinforcement Learning to Localize for Visual Object Tracking
by: Chen, Xin, et al.
Published: (2026)
by: Chen, Xin, et al.
Published: (2026)
Explore with Long-term Memory: A Benchmark and Multimodal LLM-based Reinforcement Learning Framework for Embodied Exploration
by: Wang, Sen, et al.
Published: (2026)
by: Wang, Sen, et al.
Published: (2026)
A Comprehensive Survey on Human Video Generation: Challenges, Methods, and Insights
by: Lei, Wentao, et al.
Published: (2024)
by: Lei, Wentao, et al.
Published: (2024)
Towards High Fidelity Face Swapping: A Comprehensive Survey and New Benchmark
by: Li, Qi, et al.
Published: (2026)
by: Li, Qi, et al.
Published: (2026)
ConceptSeg-R1: Segment Any Concept via Meta-Reinforcement Learning
by: Zhao, Yuan, et al.
Published: (2026)
by: Zhao, Yuan, et al.
Published: (2026)
Sparse Model Inversion: Efficient Inversion of Vision Transformers for Data-Free Applications
by: Hu, Zixuan, et al.
Published: (2025)
by: Hu, Zixuan, et al.
Published: (2025)
Towards Effective Data-Free Knowledge Distillation via Diverse Diffusion Augmentation
by: Li, Muquan, et al.
Published: (2024)
by: Li, Muquan, et al.
Published: (2024)
Dense Cross-Connected Ensemble Convolutional Neural Networks for Enhanced Model Robustness
by: Wang, Longwei, et al.
Published: (2024)
by: Wang, Longwei, et al.
Published: (2024)
Contact-aware Human Motion Generation from Textual Descriptions
by: Ma, Sihan, et al.
Published: (2024)
by: Ma, Sihan, et al.
Published: (2024)
PoseBench: Benchmarking the Robustness of Pose Estimation Models under Corruptions
by: Ma, Sihan, et al.
Published: (2024)
by: Ma, Sihan, et al.
Published: (2024)
A Survey on Agentic Multimodal Large Language Models
by: Yao, Huanjin, et al.
Published: (2025)
by: Yao, Huanjin, et al.
Published: (2025)
Video-RAG: Visually-aligned Retrieval-Augmented Long Video Comprehension
by: Luo, Yongdong, et al.
Published: (2024)
by: Luo, Yongdong, et al.
Published: (2024)
Dr. Seg: Revisiting GRPO Training for Visual Large Language Models through Perception-Oriented Design
by: Sun, Haoxiang, et al.
Published: (2026)
by: Sun, Haoxiang, et al.
Published: (2026)
Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding
by: Yuan, Liping, et al.
Published: (2025)
by: Yuan, Liping, et al.
Published: (2025)
MME-Survey: A Comprehensive Survey on Evaluation of Multimodal LLMs
by: Fu, Chaoyou, et al.
Published: (2024)
by: Fu, Chaoyou, et al.
Published: (2024)
Deep Learning in Palmprint Recognition-A Comprehensive Survey
by: Gao, Chengrui, et al.
Published: (2025)
by: Gao, Chengrui, et al.
Published: (2025)
Evaluating Adversarial Protections for Diffusion Personalization: A Comprehensive Study
by: Ye, Kai, et al.
Published: (2025)
by: Ye, Kai, et al.
Published: (2025)
PiSA: A Self-Augmented Data Engine and Training Strategy for 3D Understanding with Large Models
by: Guo, Zilu, et al.
Published: (2025)
by: Guo, Zilu, et al.
Published: (2025)
Recent Advances in Multi-modal 3D Intelligence: A Comprehensive Survey and Evaluation
by: Lei, Yinjie, et al.
Published: (2023)
by: Lei, Yinjie, et al.
Published: (2023)
MME-Reasoning: A Comprehensive Benchmark for Logical Reasoning in MLLMs
by: Yuan, Jiakang, et al.
Published: (2025)
by: Yuan, Jiakang, et al.
Published: (2025)
Diffusion-Based Visual Art Creation: A Survey and New Perspectives
by: Wang, Bingyuan, et al.
Published: (2024)
by: Wang, Bingyuan, et al.
Published: (2024)
Diffusion Models and Representation Learning: A Survey
by: Fuest, Michael, et al.
Published: (2024)
by: Fuest, Michael, et al.
Published: (2024)
MODIX: A Training-Free Multimodal Information-Driven Positional Index Scaling for Vision-Language Models
by: Huang, Ruoxiang, et al.
Published: (2026)
by: Huang, Ruoxiang, et al.
Published: (2026)
Review of Hallucination Understanding in Large Language and Vision Models
by: Ho, Zhengyi, et al.
Published: (2025)
by: Ho, Zhengyi, et al.
Published: (2025)
Image-to-Video Transfer Learning based on Image-Language Foundation Models: A Comprehensive Survey
by: Li, Jinxuan, et al.
Published: (2025)
by: Li, Jinxuan, et al.
Published: (2025)
Revisiting Data Augmentation in Deep Reinforcement Learning
by: Hu, Jianshu, et al.
Published: (2024)
by: Hu, Jianshu, et al.
Published: (2024)
SpatialLLM: From Multi-modality Data to Urban Spatial Intelligence
by: Chen, Jiabin, et al.
Published: (2025)
by: Chen, Jiabin, et al.
Published: (2025)
DeepSport: A Multimodal Large Language Model for Comprehensive Sports Video Reasoning via Agentic Reinforcement Learning
by: Zou, Junbo, et al.
Published: (2025)
by: Zou, Junbo, et al.
Published: (2025)
Jigsaw-R1: A Study of Rule-based Visual Reinforcement Learning with Jigsaw Puzzles
by: Wang, Zifu, et al.
Published: (2025)
by: Wang, Zifu, et al.
Published: (2025)
Similar Items
-
Learning to Manipulate Anywhere: A Visual Generalizable Framework For Reinforcement Learning
by: Yuan, Zhecheng, et al.
Published: (2024) -
Learning to Learn from APIs: Black-Box Data-Free Meta-Learning
by: Hu, Zixuan, et al.
Published: (2023) -
Architecture, Dataset and Model-Scale Agnostic Data-free Meta-Learning
by: Hu, Zixuan, et al.
Published: (2023) -
Who Generated This 3D Asset? Learning Source Attribution for Generative 3D Models
by: Ma, Sihan, et al.
Published: (2026) -
VACoT: Rethinking Visual Data Augmentation with VLMs
by: Xu, Zhengzhuo, et al.
Published: (2025)