ChronoForge-RL: Chronological Forging through Reinforcement Learning for Enhanced Video Understanding
Fuente:
arXiv
Salvato in:
| Autore principale: | Chen, Kehua |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
PyVision-RL: Forging Open Agentic Vision Models via RL
di: Zhao, Shitian, et al.
Pubblicazione: (2026)
di: Zhao, Shitian, et al.
Pubblicazione: (2026)
RLAnything: Forge Environment, Policy, and Reward Model in Completely Dynamic RL System
di: Wang, Yinjie, et al.
Pubblicazione: (2026)
di: Wang, Yinjie, et al.
Pubblicazione: (2026)
StyleForge: Enhancing Text-to-Image Synthesis for Any Artistic Styles with Dual Binding
di: Park, Junseo, et al.
Pubblicazione: (2024)
di: Park, Junseo, et al.
Pubblicazione: (2024)
SAFIRE: Segment Any Forged Image Region
di: Kwon, Myung-Joon, et al.
Pubblicazione: (2024)
di: Kwon, Myung-Joon, et al.
Pubblicazione: (2024)
ForgeVLA: Federated Vision-Language-Action Learning without Language Annotations
di: Zhou, Yuhao, et al.
Pubblicazione: (2026)
di: Zhou, Yuhao, et al.
Pubblicazione: (2026)
DeepForgeSeal: Latent Space-Driven Semi-Fragile Watermarking for Deepfake Detection Using Multi-Agent Adversarial Reinforcement Learning
di: Fernando, Tharindu, et al.
Pubblicazione: (2025)
di: Fernando, Tharindu, et al.
Pubblicazione: (2025)
WebForge: Breaking the Realism-Reproducibility-Scalability Trilemma in Browser Agent Benchmark
di: Yuan, Peng, et al.
Pubblicazione: (2026)
di: Yuan, Peng, et al.
Pubblicazione: (2026)
Semore: VLM-guided Enhanced Semantic Motion Representations for Visual Reinforcement Learning
di: Wang, Wentao, et al.
Pubblicazione: (2025)
di: Wang, Wentao, et al.
Pubblicazione: (2025)
PromptForge-350k: A Large-Scale Dataset and Contrastive Framework for Prompt-Based AI Image Forgery Localization
di: Wang, Jianpeng, et al.
Pubblicazione: (2026)
di: Wang, Jianpeng, et al.
Pubblicazione: (2026)
SpatialForge: Bootstrapping 3D-Aware Spatial Reasoning from Open-World 2D Images
di: Liu, Zishan, et al.
Pubblicazione: (2026)
di: Liu, Zishan, et al.
Pubblicazione: (2026)
FunCineForge: A Unified Dataset Toolkit and Model for Zero-Shot Movie Dubbing in Diverse Cinematic Scenes
di: Liu, Jiaxuan, et al.
Pubblicazione: (2026)
di: Liu, Jiaxuan, et al.
Pubblicazione: (2026)
SemiHMER: Semi-supervised Handwritten Mathematical Expression Recognition using pseudo-labels
di: Chen, Kehua, et al.
Pubblicazione: (2025)
di: Chen, Kehua, et al.
Pubblicazione: (2025)
FloraForge: LLM-Assisted Procedural Generation of Editable and Analysis-Ready 3D Plant Geometric Models For Agricultural Applications
di: Hadadi, Mozhgan, et al.
Pubblicazione: (2025)
di: Hadadi, Mozhgan, et al.
Pubblicazione: (2025)
PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning
di: Zhang, Yizhen, et al.
Pubblicazione: (2025)
di: Zhang, Yizhen, et al.
Pubblicazione: (2025)
Relation Learning and Aggregate-attention for Multi-person Motion Prediction
di: Qu, Kehua, et al.
Pubblicazione: (2024)
di: Qu, Kehua, et al.
Pubblicazione: (2024)
UnityGraph: Unified Learning of Spatio-temporal features for Multi-person Motion Prediction
di: Qu, Kehua, et al.
Pubblicazione: (2024)
di: Qu, Kehua, et al.
Pubblicazione: (2024)
Contribution-aware Token Compression for Efficient Video Understanding via Reinforcement Learning
di: Ma, Yinchao, et al.
Pubblicazione: (2026)
di: Ma, Yinchao, et al.
Pubblicazione: (2026)
Think with Grounding: Curriculum Reinforced Reasoning with Video Grounding for Long Video Understanding
di: Chen, Houlun, et al.
Pubblicazione: (2026)
di: Chen, Houlun, et al.
Pubblicazione: (2026)
Reinforcing Structured Chain-of-Thought for Video Understanding
di: Wang, Peiyao, et al.
Pubblicazione: (2026)
di: Wang, Peiyao, et al.
Pubblicazione: (2026)
Transferable Black-Box One-Shot Forging of Watermarks via Image Preference Models
di: Souček, Tomáš, et al.
Pubblicazione: (2025)
di: Souček, Tomáš, et al.
Pubblicazione: (2025)
EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models
di: Fang, Yiyang, et al.
Pubblicazione: (2026)
di: Fang, Yiyang, et al.
Pubblicazione: (2026)
VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning
di: Wang, Qiuchen, et al.
Pubblicazione: (2025)
di: Wang, Qiuchen, et al.
Pubblicazione: (2025)
VERHallu: Evaluating and Mitigating Event Relation Hallucination in Video Large Language Models
di: Zhang, Zefan, et al.
Pubblicazione: (2026)
di: Zhang, Zefan, et al.
Pubblicazione: (2026)
ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning
di: Xu, Ziqiang, et al.
Pubblicazione: (2025)
di: Xu, Ziqiang, et al.
Pubblicazione: (2025)
Spatial-SSRL: Enhancing Spatial Understanding via Self-Supervised Reinforcement Learning
di: Liu, Yuhong, et al.
Pubblicazione: (2025)
di: Liu, Yuhong, et al.
Pubblicazione: (2025)
Chronological Contrastive Learning: Few-Shot Progression Assessment in Irreversible Diseases
di: Watzenböck, Clemens, et al.
Pubblicazione: (2026)
di: Watzenböck, Clemens, et al.
Pubblicazione: (2026)
RL-I2IT: Image-to-Image Translation with Deep Reinforcement Learning
di: Hu, Jing, et al.
Pubblicazione: (2023)
di: Hu, Jing, et al.
Pubblicazione: (2023)
VidBridge-R1: Bridging QA and Captioning for RL-based Video Understanding Models with Intermediate Proxy Tasks
di: Chen, Xinlong, et al.
Pubblicazione: (2025)
di: Chen, Xinlong, et al.
Pubblicazione: (2025)
RL-Pruner: Structured Pruning Using Reinforcement Learning for CNN Compression and Acceleration
di: Wang, Boyao, et al.
Pubblicazione: (2024)
di: Wang, Boyao, et al.
Pubblicazione: (2024)
TRIMMER: A New Paradigm for Video Summarization through Self-Supervised Reinforcement Learning
di: Mishra, Pritam, et al.
Pubblicazione: (2026)
di: Mishra, Pritam, et al.
Pubblicazione: (2026)
Scaling RL to Long Videos
di: Chen, Yukang, et al.
Pubblicazione: (2025)
di: Chen, Yukang, et al.
Pubblicazione: (2025)
ChemVA: Advancing Large Language Models on Chemical Reaction Diagrams Understanding
di: Rao, Mingyang, et al.
Pubblicazione: (2026)
di: Rao, Mingyang, et al.
Pubblicazione: (2026)
ArtAug: Enhancing Text-to-Image Generation through Synthesis-Understanding Interaction
di: Duan, Zhongjie, et al.
Pubblicazione: (2024)
di: Duan, Zhongjie, et al.
Pubblicazione: (2024)
Enhancing Long Video Understanding via Hierarchical Event-Based Memory
di: Cheng, Dingxin, et al.
Pubblicazione: (2024)
di: Cheng, Dingxin, et al.
Pubblicazione: (2024)
Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning
di: Yue, Feng, et al.
Pubblicazione: (2025)
di: Yue, Feng, et al.
Pubblicazione: (2025)
Personalized Video Summarization by Multimodal Video Understanding
di: Chen, Brian, et al.
Pubblicazione: (2024)
di: Chen, Brian, et al.
Pubblicazione: (2024)
Video-CCAM: Enhancing Video-Language Understanding with Causal Cross-Attention Masks for Short and Long Videos
di: Fei, Jiajun, et al.
Pubblicazione: (2024)
di: Fei, Jiajun, et al.
Pubblicazione: (2024)
IPFormer-VideoLLM: Enhancing Multi-modal Video Understanding for Multi-shot Scenes
di: Liang, Yujia, et al.
Pubblicazione: (2025)
di: Liang, Yujia, et al.
Pubblicazione: (2025)
Enhancing Video Understanding: Deep Neural Networks for Spatiotemporal Analysis
di: Fadaei, Amir Hosein, et al.
Pubblicazione: (2025)
di: Fadaei, Amir Hosein, et al.
Pubblicazione: (2025)
Manifold-Aware Exploration for Reinforcement Learning in Video Generation
di: Zheng, Mingzhe, et al.
Pubblicazione: (2026)
di: Zheng, Mingzhe, et al.
Pubblicazione: (2026)
Documenti analoghi
-
PyVision-RL: Forging Open Agentic Vision Models via RL
di: Zhao, Shitian, et al.
Pubblicazione: (2026) -
RLAnything: Forge Environment, Policy, and Reward Model in Completely Dynamic RL System
di: Wang, Yinjie, et al.
Pubblicazione: (2026) -
StyleForge: Enhancing Text-to-Image Synthesis for Any Artistic Styles with Dual Binding
di: Park, Junseo, et al.
Pubblicazione: (2024) -
SAFIRE: Segment Any Forged Image Region
di: Kwon, Myung-Joon, et al.
Pubblicazione: (2024) -
ForgeVLA: Federated Vision-Language-Action Learning without Language Annotations
di: Zhou, Yuhao, et al.
Pubblicazione: (2026)