Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Keliang, Yang, Dingkang, Qian, Ziyun, Yin, Weijie, Wang, Yuchi, Li, Hongsheng, Liu, Jun, Zhai, Peng, Liu, Yang, Zhang, Lihua |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Improving Multimodal Sentiment Analysis via Modality Optimization and Dynamic Primary Modality Selection
par: Yang, Dingkang, et autres
Publié: (2025)
par: Yang, Dingkang, et autres
Publié: (2025)
Adaptive Reinforcement for Open-ended Medical Reasoning via Semantic-Guided Reward Collapse Mitigation
par: Liu, Yizhou, et autres
Publié: (2025)
par: Liu, Yizhou, et autres
Publié: (2025)
Resolving Evidence Sparsity: Agentic Context Engineering for Long-Document Understanding
par: Liu, Keliang, et autres
Publié: (2025)
par: Liu, Keliang, et autres
Publié: (2025)
Large Vision-Language Models as Emotion Recognizers in Context Awareness
par: Lei, Yuxuan, et autres
Publié: (2024)
par: Lei, Yuxuan, et autres
Publié: (2024)
SMCD: High Realism Motion Style Transfer via Mamba-based Diffusion
par: Qian, Ziyun, et autres
Publié: (2024)
par: Qian, Ziyun, et autres
Publié: (2024)
Can LLMs' Tuning Methods Work in Medical Multimodal Domain?
par: Chen, Jiawei, et autres
Publié: (2024)
par: Chen, Jiawei, et autres
Publié: (2024)
Faster Diffusion Action Segmentation
par: Wang, Shuaibing, et autres
Publié: (2024)
par: Wang, Shuaibing, et autres
Publié: (2024)
HandGCAT: Occlusion-Robust 3D Hand Mesh Reconstruction from Monocular Images
par: Wang, Shuaibing, et autres
Publié: (2024)
par: Wang, Shuaibing, et autres
Publié: (2024)
Asynchronous Multimodal Video Sequence Fusion via Learning Modality-Exclusive and -Agnostic Representations
par: Yang, Dingkang, et autres
Publié: (2024)
par: Yang, Dingkang, et autres
Publié: (2024)
Graph Learning and Its Advancements on Large Language Models: A Holistic Survey
par: Wei, Shaopeng, et autres
Publié: (2022)
par: Wei, Shaopeng, et autres
Publié: (2022)
MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation
par: Li, Mingcheng, et autres
Publié: (2025)
par: Li, Mingcheng, et autres
Publié: (2025)
FinHarness: An Inline Lifecycle Safety Harness for Finance LLM Agents
par: Jia, Haoxuan, et autres
Publié: (2026)
par: Jia, Haoxuan, et autres
Publié: (2026)
OmniFysics: Towards Physical Intelligence Evolution via Omni-Modal Signal Processing and Network Optimization
par: Han, Minghao, et autres
Publié: (2026)
par: Han, Minghao, et autres
Publié: (2026)
PediatricsGPT: Large Language Models as Chinese Medical Assistants for Pediatric Applications
par: Yang, Dingkang, et autres
Publié: (2024)
par: Yang, Dingkang, et autres
Publié: (2024)
Composition-RL: Compose Your Verifiable Prompts for Reinforcement Learning of Large Language Models
par: Xu, Xin, et autres
Publié: (2026)
par: Xu, Xin, et autres
Publié: (2026)
Towards Multimodal Sentiment Analysis Debiasing via Bias Purification
par: Yang, Dingkang, et autres
Publié: (2024)
par: Yang, Dingkang, et autres
Publié: (2024)
Large-scale User Game Lifecycle Representation Learning
par: Gou, Yanjie, et autres
Publié: (2025)
par: Gou, Yanjie, et autres
Publié: (2025)
Correlation-Decoupled Knowledge Distillation for Multimodal Sentiment Analysis with Incomplete Modalities
par: Li, Mingcheng, et autres
Publié: (2024)
par: Li, Mingcheng, et autres
Publié: (2024)
FysicsWorld: A Unified Full-Modality Benchmark for Any-to-Any Understanding, Generation, and Reasoning
par: Jiang, Yue, et autres
Publié: (2025)
par: Jiang, Yue, et autres
Publié: (2025)
MedAide: Information Fusion and Anatomy of Medical Intents via LLM-based Agent Collaboration
par: Yang, Dingkang, et autres
Publié: (2024)
par: Yang, Dingkang, et autres
Publié: (2024)
Toward Robust Incomplete Multimodal Sentiment Analysis via Hierarchical Representation Learning
par: Li, Mingcheng, et autres
Publié: (2024)
par: Li, Mingcheng, et autres
Publié: (2024)
Improving Factuality in Large Language Models via Decoding-Time Hallucinatory and Truthful Comparators
par: Yang, Dingkang, et autres
Publié: (2024)
par: Yang, Dingkang, et autres
Publié: (2024)
Forging a Dynamic Memory: Retrieval-Guided Continual Learning for Generalist Medical Foundation Models
par: Chen, Zizhi, et autres
Publié: (2025)
par: Chen, Zizhi, et autres
Publié: (2025)
Skip and Skip: Segmenting Medical Images with Prompts
par: Chen, Jiawei, et autres
Publié: (2024)
par: Chen, Jiawei, et autres
Publié: (2024)
Survey of Specialized Large Language Model
par: Yang, Chenghan, et autres
Publié: (2025)
par: Yang, Chenghan, et autres
Publié: (2025)
When Visual Privacy Protection Meets Multimodal Large Language Models
par: Hui, Xiaofei, et autres
Publié: (2026)
par: Hui, Xiaofei, et autres
Publié: (2026)
Engineering Microorganisms for Cancer Immunotherapy
par: Dingkang Liu, et autres
Publié: (2024)
par: Dingkang Liu, et autres
Publié: (2024)
De-confounded Data-free Knowledge Distillation for Handling Distribution Shifts
par: Wang, Yuzheng, et autres
Publié: (2024)
par: Wang, Yuzheng, et autres
Publié: (2024)
BloomScene: Lightweight Structured 3D Gaussian Splatting for Crossmodal Scene Generation
par: Hou, Xiaolu, et autres
Publié: (2025)
par: Hou, Xiaolu, et autres
Publié: (2025)
PersonaAnimator: Personalized Motion Transfer from Unconstrained Videos
par: Qian, Ziyun, et autres
Publié: (2025)
par: Qian, Ziyun, et autres
Publié: (2025)
Generalized Video Anomaly Event Detection: Systematic Taxonomy and Comparison of Deep Models
par: Liu, Yang, et autres
Publié: (2023)
par: Liu, Yang, et autres
Publié: (2023)
Mining Characteristics of Vulnerable Smart Contracts Across Lifecycle Stages
par: Peng, Hongli, et autres
Publié: (2025)
par: Peng, Hongli, et autres
Publié: (2025)
Distribution Matching Distillation Meets Reinforcement Learning
par: Jiang, Dengyang, et autres
Publié: (2025)
par: Jiang, Dengyang, et autres
Publié: (2025)
Personalised Language Learning Through Technology: Examining How Digital Literacy Shapes Proficiency and Communication Strategiess
par: Ziyun Zhang, et autres
Publié: (2025)
par: Ziyun Zhang, et autres
Publié: (2025)
Privacy-Preserving Video Anomaly Detection: A Survey
par: Liu, Yang, et autres
Publié: (2024)
par: Liu, Yang, et autres
Publié: (2024)
Prompting Large Language Models to Tackle the Full Software Development Lifecycle: A Case Study
par: Li, Bowen, et autres
Publié: (2024)
par: Li, Bowen, et autres
Publié: (2024)
SafeHarness: Lifecycle-Integrated Security Architecture for LLM-based Agent Deployment
par: Lin, Xixun, et autres
Publié: (2026)
par: Lin, Xixun, et autres
Publié: (2026)
MEML-GRPO: Heterogeneous Multi-Expert Mutual Learning for RLVR Advancement
par: Jia, Weitao, et autres
Publié: (2025)
par: Jia, Weitao, et autres
Publié: (2025)
ProFocus: Proactive Perception and Focused Reasoning in Vision-and-Language Navigation
par: Xue, Wei, et autres
Publié: (2026)
par: Xue, Wei, et autres
Publié: (2026)
Large Language Models Meet NLP: A Survey
par: Qin, Libo, et autres
Publié: (2024)
par: Qin, Libo, et autres
Publié: (2024)
Documents similaires
-
Improving Multimodal Sentiment Analysis via Modality Optimization and Dynamic Primary Modality Selection
par: Yang, Dingkang, et autres
Publié: (2025) -
Adaptive Reinforcement for Open-ended Medical Reasoning via Semantic-Guided Reward Collapse Mitigation
par: Liu, Yizhou, et autres
Publié: (2025) -
Resolving Evidence Sparsity: Agentic Context Engineering for Long-Document Understanding
par: Liu, Keliang, et autres
Publié: (2025) -
Large Vision-Language Models as Emotion Recognizers in Context Awareness
par: Lei, Yuxuan, et autres
Publié: (2024) -
SMCD: High Realism Motion Style Transfer via Mamba-based Diffusion
par: Qian, Ziyun, et autres
Publié: (2024)