DeepVideo-R1: Video Reinforcement Fine-Tuning via Difficulty-aware Regressive GRPO
Fuente:
arXiv
Guardado en:
| Autores principales: | Park, Jinyoung, Na, Jeehye, Kim, Jinyoung, Kim, Hyunwoo J. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
VidChain: Chain-of-Tasks with Metric-based Direct Preference Optimization for Dense Video Captioning
por: Lee, Ji Soo, et al.
Publicado: (2025)
por: Lee, Ji Soo, et al.
Publicado: (2025)
Difficulty-aware Balancing Margin Loss for Long-tailed Recognition
por: Son, Minseok, et al.
Publicado: (2024)
por: Son, Minseok, et al.
Publicado: (2024)
Improving Large Molecular Language Model via Relation-aware Multimodal Collaboration
por: Park, Jinyoung, et al.
Publicado: (2026)
por: Park, Jinyoung, et al.
Publicado: (2026)
Rethinking Garment Conditioning in Diffusion-based Virtual Try-On
por: Na, Kihyun, et al.
Publicado: (2025)
por: Na, Kihyun, et al.
Publicado: (2025)
FIFO-Diffusion: Generating Infinite Videos from Text without Training
por: Kim, Jihwan, et al.
Publicado: (2024)
por: Kim, Jihwan, et al.
Publicado: (2024)
MoE-GRPO: Optimizing Mixture-of-Experts via Reinforcement Learning in Vision-Language Models
por: Ko, Dohwan, et al.
Publicado: (2026)
por: Ko, Dohwan, et al.
Publicado: (2026)
Adaptive Self-training Framework for Fine-grained Scene Graph Generation
por: Kim, Kibum, et al.
Publicado: (2024)
por: Kim, Kibum, et al.
Publicado: (2024)
GCAgent: Long-Video Understanding via Schematic and Narrative Episodic Memory
por: Yeo, Jeong Hun, et al.
Publicado: (2025)
por: Yeo, Jeong Hun, et al.
Publicado: (2025)
Prompt Learning via Meta-Regularization
por: Park, Jinyoung, et al.
Publicado: (2024)
por: Park, Jinyoung, et al.
Publicado: (2024)
Groupwise Query Specialization and Quality-Aware Multi-Assignment for Transformer-based Visual Relationship Detection
por: Kim, Jongha, et al.
Publicado: (2024)
por: Kim, Jongha, et al.
Publicado: (2024)
Holi-DETR: Holistic Fashion Item Detection Leveraging Contextual Information
por: Kwon, Youngchae, et al.
Publicado: (2025)
por: Kwon, Youngchae, et al.
Publicado: (2025)
Item Region-based Style Classification Network (IRSN): A Fashion Style Classifier Based on Domain Knowledge of Fashion Experts
por: Choi, Jinyoung, et al.
Publicado: (2025)
por: Choi, Jinyoung, et al.
Publicado: (2025)
MF-LPR$^2$: Multi-Frame License Plate Image Restoration and Recognition using Optical Flow
por: Na, Kihyun, et al.
Publicado: (2025)
por: Na, Kihyun, et al.
Publicado: (2025)
VideoMamba: Spatio-Temporal Selective State Space Model
por: Park, Jinyoung, et al.
Publicado: (2024)
por: Park, Jinyoung, et al.
Publicado: (2024)
Multimodal Alignment with Cross-Attentive GRUs for Fine-Grained Video Understanding
por: Kim, Namho, et al.
Publicado: (2025)
por: Kim, Namho, et al.
Publicado: (2025)
Relevance-aware Multi-context Contrastive Decoding for Retrieval-augmented Visual Question Answering
por: Kim, Jongha, et al.
Publicado: (2026)
por: Kim, Jongha, et al.
Publicado: (2026)
LLM4SGG: Large Language Models for Weakly Supervised Scene Graph Generation
por: Kim, Kibum, et al.
Publicado: (2023)
por: Kim, Kibum, et al.
Publicado: (2023)
VGenST-Bench: A Benchmark for Spatio-Temporal Reasoning via Active Video Synthesis
por: Park, Jinho, et al.
Publicado: (2026)
por: Park, Jinho, et al.
Publicado: (2026)
RegFormer: Transferable Relational Grounding for Efficient Weakly-Supervised Human-Object Interaction Detection
por: Park, Jihwan, et al.
Publicado: (2026)
por: Park, Jihwan, et al.
Publicado: (2026)
Weakly Supervised Video Scene Graph Generation via Natural Language Supervision
por: Kim, Kibum, et al.
Publicado: (2025)
por: Kim, Kibum, et al.
Publicado: (2025)
3D-RFT: Reinforcement Fine-Tuning for Video-based 3D Scene Understanding
por: Linghu, Xiongkun, et al.
Publicado: (2026)
por: Linghu, Xiongkun, et al.
Publicado: (2026)
Contribution-aware Token Compression for Efficient Video Understanding via Reinforcement Learning
por: Ma, Yinchao, et al.
Publicado: (2026)
por: Ma, Yinchao, et al.
Publicado: (2026)
Towards Efficient Vision State Space Models via Token Merging
por: Park, Jinyoung, et al.
Publicado: (2025)
por: Park, Jinyoung, et al.
Publicado: (2025)
Watch Video, Catch Keyword: Context-aware Keyword Attention for Moment Retrieval and Highlight Detection
por: Um, Sung Jin, et al.
Publicado: (2025)
por: Um, Sung Jin, et al.
Publicado: (2025)
Jailbreaking on Text-to-Video Models via Scene Splitting Strategy
por: Lee, Wonjun, et al.
Publicado: (2025)
por: Lee, Wonjun, et al.
Publicado: (2025)
MedErr-CT: A Visual Question Answering Benchmark for Identifying and Correcting Errors in CT Reports
por: Kyung, Sunggu, et al.
Publicado: (2025)
por: Kyung, Sunggu, et al.
Publicado: (2025)
Video-STaR: Self-Training Enables Video Instruction Tuning with Any Supervision
por: Zohar, Orr, et al.
Publicado: (2024)
por: Zohar, Orr, et al.
Publicado: (2024)
3DPhysVideo: Consistency-Guided Flow SDE for Video Generation via 3D Scene Reconstruction and Physical Simulation
por: Kim, Hwidong, et al.
Publicado: (2026)
por: Kim, Hwidong, et al.
Publicado: (2026)
Memory-Efficient Fine-Tuning Diffusion Transformers via Dynamic Patch Sampling and Block Skipping
por: Park, Sunghyun, et al.
Publicado: (2026)
por: Park, Sunghyun, et al.
Publicado: (2026)
V.I.P. : Iterative Online Preference Distillation for Efficient Video Diffusion Models
por: Kim, Jisoo, et al.
Publicado: (2025)
por: Kim, Jisoo, et al.
Publicado: (2025)
VideoICL: Confidence-based Iterative In-context Learning for Out-of-Distribution Video Understanding
por: Kim, Kangsan, et al.
Publicado: (2024)
por: Kim, Kangsan, et al.
Publicado: (2024)
Hand-object reconstruction via interaction-aware graph attention mechanism
por: Woo, Taeyun, et al.
Publicado: (2024)
por: Woo, Taeyun, et al.
Publicado: (2024)
Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models through Reinforcement Learning from Ranking Feedback
por: Shi, Derek, et al.
Publicado: (2025)
por: Shi, Derek, et al.
Publicado: (2025)
Place-it-R1: Unlocking Environment-aware Reasoning Potential of MLLM for Video Object Insertion
por: Gu, Bohai, et al.
Publicado: (2026)
por: Gu, Bohai, et al.
Publicado: (2026)
Model Already Knows the Best Noise: Bayesian Active Noise Selection via Attention in Video Diffusion Model
por: Kim, Kwanyoung, et al.
Publicado: (2025)
por: Kim, Kwanyoung, et al.
Publicado: (2025)
Geo-R1: Improving Few-Shot Geospatial Referring Expression Understanding with Reinforcement Fine-Tuning
por: Zhang, Zilun, et al.
Publicado: (2025)
por: Zhang, Zilun, et al.
Publicado: (2025)
HiCM$^2$: Hierarchical Compact Memory Modeling for Dense Video Captioning
por: Kim, Minkuk, et al.
Publicado: (2024)
por: Kim, Minkuk, et al.
Publicado: (2024)
Do You Remember? Dense Video Captioning with Cross-Modal Memory Retrieval
por: Kim, Minkuk, et al.
Publicado: (2024)
por: Kim, Minkuk, et al.
Publicado: (2024)
3D-Aware Vision-Language Models Fine-Tuning with Geometric Distillation
por: Lee, Seonho, et al.
Publicado: (2025)
por: Lee, Seonho, et al.
Publicado: (2025)
Visual Agentic Reinforcement Fine-Tuning
por: Liu, Ziyu, et al.
Publicado: (2025)
por: Liu, Ziyu, et al.
Publicado: (2025)
Ejemplares similares
-
VidChain: Chain-of-Tasks with Metric-based Direct Preference Optimization for Dense Video Captioning
por: Lee, Ji Soo, et al.
Publicado: (2025) -
Difficulty-aware Balancing Margin Loss for Long-tailed Recognition
por: Son, Minseok, et al.
Publicado: (2024) -
Improving Large Molecular Language Model via Relation-aware Multimodal Collaboration
por: Park, Jinyoung, et al.
Publicado: (2026) -
Rethinking Garment Conditioning in Diffusion-based Virtual Try-On
por: Na, Kihyun, et al.
Publicado: (2025) -
FIFO-Diffusion: Generating Infinite Videos from Text without Training
por: Kim, Jihwan, et al.
Publicado: (2024)