Enregistré dans:
| Auteurs principaux: | Yao, Jiashu, Huang, Heyan, Zeng, Shuang, Luo, Chuwei, You, WangJie, Tang, Jie, Liu, Qingsong, Guo, Yuhang, Kang, Yangyang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2511.16331 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Policy Split: Incentivizing Dual-Mode Exploration in LLM Reinforcement with Dual-Mode Entropy Regularization
par: Yao, Jiashu, et autres
Publié: (2026)
par: Yao, Jiashu, et autres
Publié: (2026)
Utilizing and Calibrating Hindsight Process Rewards via Reinforcement with Mutual Information Self-Evaluation
par: Yao, Jiashu, et autres
Publié: (2026)
par: Yao, Jiashu, et autres
Publié: (2026)
Optimizing Chain-of-Thought Reasoning: Tackling Arranging Bottleneck via Plan Augmentation
par: Qiu, Yuli, et autres
Publié: (2024)
par: Qiu, Yuli, et autres
Publié: (2024)
Deterministic Reversible Data Augmentation for Neural Machine Translation
par: Yao, Jiashu, et autres
Publié: (2024)
par: Yao, Jiashu, et autres
Publié: (2024)
ReFF: Reinforcing Format Faithfulness in Language Models across Varied Tasks
par: Yao, Jiashu, et autres
Publié: (2024)
par: Yao, Jiashu, et autres
Publié: (2024)
HomeSafeBench: A Benchmark for Embodied Vision-Language Models in Free-Exploration Home Safety Inspection
par: Gao, Siyuan, et autres
Publié: (2025)
par: Gao, Siyuan, et autres
Publié: (2025)
MemoryRewardBench: Benchmarking Reward Models for Long-Term Memory Management in Large Language Models
par: Tang, Zecheng, et autres
Publié: (2026)
par: Tang, Zecheng, et autres
Publié: (2026)
DocMEdit: Towards Document-Level Model Editing
par: Zeng, Li, et autres
Publié: (2025)
par: Zeng, Li, et autres
Publié: (2025)
Beyond Literal Mapping: Benchmarking and Improving Non-Literal Translation Evaluation
par: Tian, Yanzhi, et autres
Publié: (2026)
par: Tian, Yanzhi, et autres
Publié: (2026)
FAME: Towards Factual Multi-Task Model Editing
par: Zeng, Li, et autres
Publié: (2024)
par: Zeng, Li, et autres
Publié: (2024)
Safely Learning with Private Data: A Federated Learning Framework for Large Language Model
par: Zheng, JiaYing, et autres
Publié: (2024)
par: Zheng, JiaYing, et autres
Publié: (2024)
LayoutLLM: Layout Instruction Tuning with Large Language Models for Document Understanding
par: Luo, Chuwei, et autres
Publié: (2024)
par: Luo, Chuwei, et autres
Publié: (2024)
HomeBench: Evaluating LLMs in Smart Homes with Valid and Invalid Instructions Across Single and Multiple Devices
par: Li, Silin, et autres
Publié: (2025)
par: Li, Silin, et autres
Publié: (2025)
How Far Are We? Systematic Evaluation of LLMs vs. Human Experts in Mathematical Contest in Modeling
par: Liu, Yuhang, et autres
Publié: (2026)
par: Liu, Yuhang, et autres
Publié: (2026)
Evaluating Accounting Reasoning Capabilities of Large Language Models
par: Zhou, Jie, et autres
Publié: (2026)
par: Zhou, Jie, et autres
Publié: (2026)
Large Language Models Cannot Self-Correct Reasoning Yet
par: Huang, Jie, et autres
Publié: (2023)
par: Huang, Jie, et autres
Publié: (2023)
Bi-VLDoc: Bidirectional Vision-Language Modeling for Visually-Rich Document Understanding
par: Luo, Chuwei, et autres
Publié: (2022)
par: Luo, Chuwei, et autres
Publié: (2022)
Who Reasons in the Large Language Models?
par: Shao, Jie, et autres
Publié: (2025)
par: Shao, Jie, et autres
Publié: (2025)
Subtopic-aware View Sampling and Temporal Aggregation for Long-form Document Matching
par: Zhou, Youchao, et autres
Publié: (2024)
par: Zhou, Youchao, et autres
Publié: (2024)
Accounting Reasoning in Large Language Models: Concepts, Evaluation, and Empirical Analysis
par: Zhou, Jie, et autres
Publié: (2025)
par: Zhou, Jie, et autres
Publié: (2025)
Impact of Fine-Tuning Methods on Memorization in Large Language Models
par: Hou, Jie, et autres
Publié: (2025)
par: Hou, Jie, et autres
Publié: (2025)
T1: Advancing Language Model Reasoning through Reinforcement Learning and Inference Scaling
par: Hou, Zhenyu, et autres
Publié: (2025)
par: Hou, Zhenyu, et autres
Publié: (2025)
Debate, Reflect, and Distill: Multi-Agent Feedback with Tree-Structured Preference Optimization for Efficient Language Model Enhancement
par: Zhou, Xiaofeng, et autres
Publié: (2025)
par: Zhou, Xiaofeng, et autres
Publié: (2025)
DHI: Leveraging Diverse Hallucination Induction for Enhanced Contrastive Factuality Control in Large Language Models
par: Guo, Jiani, et autres
Publié: (2026)
par: Guo, Jiani, et autres
Publié: (2026)
Stepwise Self-Consistent Mathematical Reasoning with Large Language Models
par: Zhao, Zilong, et autres
Publié: (2024)
par: Zhao, Zilong, et autres
Publié: (2024)
Segment Policy Optimization: Effective Segment-Level Credit Assignment in RL for Large Language Models
par: Guo, Yiran, et autres
Publié: (2025)
par: Guo, Yiran, et autres
Publié: (2025)
PRIM: Towards Practical In-Image Multilingual Machine Translation
par: Tian, Yanzhi, et autres
Publié: (2025)
par: Tian, Yanzhi, et autres
Publié: (2025)
LLMs Judge Themselves: A Game-Theoretic Framework for Human-Aligned Evaluation
par: Yang, Gao, et autres
Publié: (2025)
par: Yang, Gao, et autres
Publié: (2025)
Large Language Model Cascades with Mixture of Thoughts Representations for Cost-efficient Reasoning
par: Yue, Murong, et autres
Publié: (2023)
par: Yue, Murong, et autres
Publié: (2023)
Towards Large Reasoning Models: A Survey of Reinforced Reasoning with Large Language Models
par: Xu, Fengli, et autres
Publié: (2025)
par: Xu, Fengli, et autres
Publié: (2025)
SIFThinker: Spatially-Aware Image Focus for Visual Reasoning
par: Chen, Zhangquan, et autres
Publié: (2025)
par: Chen, Zhangquan, et autres
Publié: (2025)
Beyond Exact Match: Semantically Reassessing Event Extraction by Large Language Models
par: Lu, Yi-Fan, et autres
Publié: (2024)
par: Lu, Yi-Fan, et autres
Publié: (2024)
TasTe: Teaching Large Language Models to Translate through Self-Reflection
par: Wang, Yutong, et autres
Publié: (2024)
par: Wang, Yutong, et autres
Publié: (2024)
GIVE: Structured Reasoning of Large Language Models with Knowledge Graph Inspired Veracity Extrapolation
par: He, Jiashu, et autres
Publié: (2024)
par: He, Jiashu, et autres
Publié: (2024)
Don't Settle Too Early: Self-Reflective Remasking for Diffusion Language Models
par: Huang, Zemin, et autres
Publié: (2025)
par: Huang, Zemin, et autres
Publié: (2025)
Self-Vocabularizing Training for Neural Machine Translation
par: Lin, Pin-Jie, et autres
Publié: (2025)
par: Lin, Pin-Jie, et autres
Publié: (2025)
Language as a Latent Variable for Reasoning Optimization
par: Wu, Linjuan, et autres
Publié: (2026)
par: Wu, Linjuan, et autres
Publié: (2026)
LogicGame: Benchmarking Rule-Based Reasoning Abilities of Large Language Models
par: Gui, Jiayi, et autres
Publié: (2024)
par: Gui, Jiayi, et autres
Publié: (2024)
GenRewrite: Query Rewriting via Large Language Models
par: Liu, Jie, et autres
Publié: (2024)
par: Liu, Jie, et autres
Publié: (2024)
CriticEval: Evaluating Large Language Model as Critic
par: Lan, Tian, et autres
Publié: (2024)
par: Lan, Tian, et autres
Publié: (2024)
Documents similaires
-
Policy Split: Incentivizing Dual-Mode Exploration in LLM Reinforcement with Dual-Mode Entropy Regularization
par: Yao, Jiashu, et autres
Publié: (2026) -
Utilizing and Calibrating Hindsight Process Rewards via Reinforcement with Mutual Information Self-Evaluation
par: Yao, Jiashu, et autres
Publié: (2026) -
Optimizing Chain-of-Thought Reasoning: Tackling Arranging Bottleneck via Plan Augmentation
par: Qiu, Yuli, et autres
Publié: (2024) -
Deterministic Reversible Data Augmentation for Neural Machine Translation
par: Yao, Jiashu, et autres
Publié: (2024) -
ReFF: Reinforcing Format Faithfulness in Language Models across Varied Tasks
par: Yao, Jiashu, et autres
Publié: (2024)