Enregistré dans:
| Auteurs principaux: | Zhi, Weihai, Guo, Jiayan, Li, Shangyang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2508.20549 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Schema-Adaptive Tabular Representation Learning with LLMs for Generalizable Multimodal Clinical Reasoning
par: Mao, Hongxi, et autres
Publié: (2026)
par: Mao, Hongxi, et autres
Publié: (2026)
AutoML-Med: A Framework for Automated Machine Learning in Medical Tabular Data
par: Francia, Riccardo, et autres
Publié: (2025)
par: Francia, Riccardo, et autres
Publié: (2025)
MedInsightBench: Evaluating Medical Analytics Agents Through Multi-Step Insight Discovery in Multimodal Medical Data
par: Zhu, Zhenghao, et autres
Publié: (2025)
par: Zhu, Zhenghao, et autres
Publié: (2025)
MedGNN: Towards Multi-resolution Spatiotemporal Graph Learning for Medical Time Series Classification
par: Fan, Wei, et autres
Publié: (2025)
par: Fan, Wei, et autres
Publié: (2025)
MedRAX: Medical Reasoning Agent for Chest X-ray
par: Fallahpour, Adibvafa, et autres
Publié: (2025)
par: Fallahpour, Adibvafa, et autres
Publié: (2025)
Breaking the Factorization Barrier in Diffusion Language Models
par: Li, Ian, et autres
Publié: (2026)
par: Li, Ian, et autres
Publié: (2026)
GR-Agent: Adaptive Graph Reasoning Agent under Incomplete Knowledge
par: Zhou, Dongzhuoran, et autres
Publié: (2025)
par: Zhou, Dongzhuoran, et autres
Publié: (2025)
Breaking the Exploration Bottleneck: Rubric-Scaffolded Reinforcement Learning for General LLM Reasoning
par: Zhou, Yang, et autres
Publié: (2025)
par: Zhou, Yang, et autres
Publié: (2025)
MedRECT: A Medical Reasoning Benchmark for Error Correction in Clinical Texts
par: Iwase, Naoto, et autres
Publié: (2025)
par: Iwase, Naoto, et autres
Publié: (2025)
DRPO: Efficient Reasoning via Decoupled Reward Policy Optimization
par: Li, Gang, et autres
Publié: (2025)
par: Li, Gang, et autres
Publié: (2025)
SemiReward: A General Reward Model for Semi-supervised Learning
par: Li, Siyuan, et autres
Publié: (2023)
par: Li, Siyuan, et autres
Publié: (2023)
From Federated Learning to X-Learning: Breaking the Barriers of Decentrality Through Random Walks
par: Salihovic, Allan, et autres
Publié: (2025)
par: Salihovic, Allan, et autres
Publié: (2025)
Entropy-Guided Data-Efficient Training for Multimodal Reasoning Reward Models
par: Yang, Shidong, et autres
Publié: (2026)
par: Yang, Shidong, et autres
Publié: (2026)
RationalRewards: Reasoning Rewards Scale Visual Generation Both Training and Test Time
par: Wang, Haozhe, et autres
Publié: (2026)
par: Wang, Haozhe, et autres
Publié: (2026)
Breaking the Modality Barrier: Generative Modeling for Accurate Molecule Retrieval from Mass Spectra
par: Zhang, Yiwen, et autres
Publié: (2025)
par: Zhang, Yiwen, et autres
Publié: (2025)
DGRO: Enhancing LLM Reasoning via Exploration-Exploitation Control and Reward Variance Management
par: Su, Xuerui, et autres
Publié: (2025)
par: Su, Xuerui, et autres
Publié: (2025)
Rewarding Graph Reasoning Process makes LLMs more Generalized Reasoners
par: Peng, Miao, et autres
Publié: (2025)
par: Peng, Miao, et autres
Publié: (2025)
Breaking the Reclustering Barrier in Centroid-based Deep Clustering
par: Miklautz, Lukas, et autres
Publié: (2024)
par: Miklautz, Lukas, et autres
Publié: (2024)
SIGMA: Refining Large Language Model Reasoning via Sibling-Guided Monte Carlo Augmentation
par: Ren, Yanwei, et autres
Publié: (2025)
par: Ren, Yanwei, et autres
Publié: (2025)
APLOT: Robust Reward Modeling via Adaptive Preference Learning with Optimal Transport
par: Li, Zhuo, et autres
Publié: (2025)
par: Li, Zhuo, et autres
Publié: (2025)
MedCLM: Learning to Localize and Reason via a CoT-Curriculum in Medical Vision-Language Models
par: Kim, Soo Yong, et autres
Publié: (2025)
par: Kim, Soo Yong, et autres
Publié: (2025)
Incentivizing Consistent, Effective and Scalable Reasoning Capability in Audio LLMs via Reasoning Process Rewards
par: Fan, Jiajun, et autres
Publié: (2025)
par: Fan, Jiajun, et autres
Publié: (2025)
CausalMed: Causality-Based Personalized Medication Recommendation Centered on Patient health state
par: Li, Xiang, et autres
Publié: (2024)
par: Li, Xiang, et autres
Publié: (2024)
Breaking the Safety-Capability Tradeoff: Reinforcement Learning with Verifiable Rewards Maintains Safety Guardrails in LLMs
par: Cho, Dongkyu Derek, et autres
Publié: (2025)
par: Cho, Dongkyu Derek, et autres
Publié: (2025)
Verifying Meta-Awareness via Predictive Rewards in Reasoning Models
par: Kim, Yoonjeon, et autres
Publié: (2025)
par: Kim, Yoonjeon, et autres
Publié: (2025)
Boosting LLM Reasoning via Human-Inspired Reward Shaping
par: Lin, Wenze, et autres
Publié: (2026)
par: Lin, Wenze, et autres
Publié: (2026)
RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents
par: Zhang, Zijing, et autres
Publié: (2025)
par: Zhang, Zijing, et autres
Publié: (2025)
Breaking the Barrier: Enhanced Utility and Robustness in Smoothed DRL Agents
par: Sun, Chung-En, et autres
Publié: (2024)
par: Sun, Chung-En, et autres
Publié: (2024)
MedXpertQA: Benchmarking Expert-Level Medical Reasoning and Understanding
par: Zuo, Yuxin, et autres
Publié: (2025)
par: Zuo, Yuxin, et autres
Publié: (2025)
MedMamba: Recasting Mamba for Medical Time Series Classification
par: He, ZhengXiao, et autres
Publié: (2026)
par: He, ZhengXiao, et autres
Publié: (2026)
Auxiliary Reward Generation with Transition Distance Representation Learning
par: Li, Siyuan, et autres
Publié: (2024)
par: Li, Siyuan, et autres
Publié: (2024)
BarrierSteer: LLM Safety via Learning Barrier Steering
par: Tran, Thanh Q., et autres
Publié: (2026)
par: Tran, Thanh Q., et autres
Publié: (2026)
Self-Rewarding Rubric-Based Reinforcement Learning for Open-Ended Reasoning
par: Ye, Zhiling, et autres
Publié: (2025)
par: Ye, Zhiling, et autres
Publié: (2025)
Accelerating LLM Reasoning via Early Rejection with Partial Reward Modeling
par: Cheshmi, Seyyed Saeid, et autres
Publié: (2025)
par: Cheshmi, Seyyed Saeid, et autres
Publié: (2025)
Beyond Scalar Reward Model: Learning Generative Judge from Preference Data
par: Ye, Ziyi, et autres
Publié: (2024)
par: Ye, Ziyi, et autres
Publié: (2024)
Generalizing Behavior via Inverse Reinforcement Learning with Closed-Form Reward Centroids
par: Lazzati, Filippo, et autres
Publié: (2025)
par: Lazzati, Filippo, et autres
Publié: (2025)
Reward Generation via Large Vision-Language Model in Offline Reinforcement Learning
par: Lee, Younghwan, et autres
Publié: (2025)
par: Lee, Younghwan, et autres
Publié: (2025)
CafeMed: Causal Attention Fusion Enhanced Medication Recommendation
par: Ren, Kelin, et autres
Publié: (2025)
par: Ren, Kelin, et autres
Publié: (2025)
MedRep: Medical Concept Representation for General Electronic Health Record Foundation Models
par: Kim, Junmo, et autres
Publié: (2025)
par: Kim, Junmo, et autres
Publié: (2025)
BWLA: Breaking the Barrier of W1AX Post-Training Quantization for LLMs
par: Zhao, Zhixiong, et autres
Publié: (2026)
par: Zhao, Zhixiong, et autres
Publié: (2026)
Documents similaires
-
Schema-Adaptive Tabular Representation Learning with LLMs for Generalizable Multimodal Clinical Reasoning
par: Mao, Hongxi, et autres
Publié: (2026) -
AutoML-Med: A Framework for Automated Machine Learning in Medical Tabular Data
par: Francia, Riccardo, et autres
Publié: (2025) -
MedInsightBench: Evaluating Medical Analytics Agents Through Multi-Step Insight Discovery in Multimodal Medical Data
par: Zhu, Zhenghao, et autres
Publié: (2025) -
MedGNN: Towards Multi-resolution Spatiotemporal Graph Learning for Medical Time Series Classification
par: Fan, Wei, et autres
Publié: (2025) -
MedRAX: Medical Reasoning Agent for Chest X-ray
par: Fallahpour, Adibvafa, et autres
Publié: (2025)