ExpLang: Improved Exploration and Exploitation in LLM Reasoning with On-Policy Thinking Language Selection
Fuente:
arXiv
Salvato in:
| Autori principali: | Gao, Changjiang, Huang, Zixian, Yang, Kaichen, Chen, Jiajun, Li, Jixing, Huang, Shujian |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Measuring Meaning Composition in the Human Brain with Composition Scores from Large Language Models
di: Gao, Changjiang, et al.
Pubblicazione: (2024)
di: Gao, Changjiang, et al.
Pubblicazione: (2024)
Multilingual Pretraining and Instruction Tuning Improve Cross-Lingual Knowledge Alignment, But Only Shallowly
di: Gao, Changjiang, et al.
Pubblicazione: (2024)
di: Gao, Changjiang, et al.
Pubblicazione: (2024)
Could Thinking Multilingually Empower LLM Reasoning?
di: Gao, Changjiang, et al.
Pubblicazione: (2025)
di: Gao, Changjiang, et al.
Pubblicazione: (2025)
TAPO: Translation Augmented Policy Optimization for Multilingual Mathematical Reasoning
di: Huang, Xu, et al.
Pubblicazione: (2026)
di: Huang, Xu, et al.
Pubblicazione: (2026)
Large Language Models are Limited in Out-of-Context Knowledge Reasoning
di: Hu, Peng, et al.
Pubblicazione: (2024)
di: Hu, Peng, et al.
Pubblicazione: (2024)
LLaMAX2: Your Translation-Enhanced Model also Performs Well in Reasoning
di: Gao, Changjiang, et al.
Pubblicazione: (2025)
di: Gao, Changjiang, et al.
Pubblicazione: (2025)
MT-PATCHER: Selective and Extendable Knowledge Distillation from Large Language Models for Machine Translation
di: Li, Jiahuan, et al.
Pubblicazione: (2024)
di: Li, Jiahuan, et al.
Pubblicazione: (2024)
Semantic-Space Exploration and Exploitation in RLVR for LLM Reasoning
di: Huang, Fanding, et al.
Pubblicazione: (2025)
di: Huang, Fanding, et al.
Pubblicazione: (2025)
Extend Adversarial Policy Against Neural Machine Translation via Unknown Token
di: Zou, Wei, et al.
Pubblicazione: (2025)
di: Zou, Wei, et al.
Pubblicazione: (2025)
Large Language Models Are Cross-Lingual Knowledge-Free Reasoners
di: Hu, Peng, et al.
Pubblicazione: (2024)
di: Hu, Peng, et al.
Pubblicazione: (2024)
PATS: Process-Level Adaptive Thinking Mode Switching
di: Wang, Yi, et al.
Pubblicazione: (2025)
di: Wang, Yi, et al.
Pubblicazione: (2025)
Getting More from Less: Large Language Models are Good Spontaneous Multilingual Learners
di: Zhang, Shimao, et al.
Pubblicazione: (2024)
di: Zhang, Shimao, et al.
Pubblicazione: (2024)
Understanding LLMs' Cross-Lingual Context Retrieval: How Good It Is And Where It Comes From
di: Gao, Changjiang, et al.
Pubblicazione: (2025)
di: Gao, Changjiang, et al.
Pubblicazione: (2025)
Formality is Favored: Unraveling the Learning Preferences of Large Language Models on Data with Conflicting Knowledge
di: Li, Jiahuan, et al.
Pubblicazione: (2024)
di: Li, Jiahuan, et al.
Pubblicazione: (2024)
R-PRM: Reasoning-Driven Process Reward Modeling
di: She, Shuaijie, et al.
Pubblicazione: (2025)
di: She, Shuaijie, et al.
Pubblicazione: (2025)
How to Fine-Tune a Reasoning Model? A Teacher-Student Cooperation Framework to Synthesize Student-Consistent SFT Data
di: Huang, Zixian, et al.
Pubblicazione: (2026)
di: Huang, Zixian, et al.
Pubblicazione: (2026)
Multi-Candidate Speculative Decoding
di: Yang, Sen, et al.
Pubblicazione: (2024)
di: Yang, Sen, et al.
Pubblicazione: (2024)
Eliciting the Translation Ability of Large Language Models via Multilingual Finetuning with Translation Instructions
di: Li, Jiahuan, et al.
Pubblicazione: (2023)
di: Li, Jiahuan, et al.
Pubblicazione: (2023)
MindMerger: Efficient Boosting LLM Reasoning in non-English Languages
di: Huang, Zixian, et al.
Pubblicazione: (2024)
di: Huang, Zixian, et al.
Pubblicazione: (2024)
Question Translation Training for Better Multilingual Reasoning
di: Zhu, Wenhao, et al.
Pubblicazione: (2024)
di: Zhu, Wenhao, et al.
Pubblicazione: (2024)
Exploring the Factual Consistency in Dialogue Comprehension of Large Language Models
di: She, Shuaijie, et al.
Pubblicazione: (2023)
di: She, Shuaijie, et al.
Pubblicazione: (2023)
The Power of Question Translation Training in Multilingual Reasoning: Broadened Scope and Deepened Insights
di: Zhu, Wenhao, et al.
Pubblicazione: (2024)
di: Zhu, Wenhao, et al.
Pubblicazione: (2024)
Understanding New-Knowledge-Induced Factual Hallucinations in LLMs: Analysis and Interpretation
di: Dang, Renfei, et al.
Pubblicazione: (2025)
di: Dang, Renfei, et al.
Pubblicazione: (2025)
Improved Paraphrase Generation via Controllable Latent Diffusion
di: Zou, Wei, et al.
Pubblicazione: (2024)
di: Zou, Wei, et al.
Pubblicazione: (2024)
EDT: Improving Large Language Models' Generation by Entropy-based Dynamic Temperature Sampling
di: Zhang, Shimao, et al.
Pubblicazione: (2024)
di: Zhang, Shimao, et al.
Pubblicazione: (2024)
Lost in the Source Language: How Large Language Models Evaluate the Quality of Machine Translation
di: Huang, Xu, et al.
Pubblicazione: (2024)
di: Huang, Xu, et al.
Pubblicazione: (2024)
Trans-Zero: Self-Play Incentivizes Large Language Models for Multilingual Translation Without Parallel Data
di: Zou, Wei, et al.
Pubblicazione: (2025)
di: Zou, Wei, et al.
Pubblicazione: (2025)
Alleviating Distribution Shift in Synthetic Data for Machine Translation Quality Estimation
di: Geng, Xiang, et al.
Pubblicazione: (2025)
di: Geng, Xiang, et al.
Pubblicazione: (2025)
PreAlign: Boosting Cross-Lingual Transfer by Early Establishment of Multilingual Alignment
di: Li, Jiahuan, et al.
Pubblicazione: (2024)
di: Li, Jiahuan, et al.
Pubblicazione: (2024)
Multilingual Contrastive Decoding via Language-Agnostic Layers Skipping
di: Zhu, Wenhao, et al.
Pubblicazione: (2024)
di: Zhu, Wenhao, et al.
Pubblicazione: (2024)
MAPO: Advancing Multilingual Reasoning through Multilingual Alignment-as-Preference Optimization
di: She, Shuaijie, et al.
Pubblicazione: (2024)
di: She, Shuaijie, et al.
Pubblicazione: (2024)
SLAM: Towards Efficient Multilingual Reasoning via Selective Language Alignment
di: Fan, Yuchun, et al.
Pubblicazione: (2025)
di: Fan, Yuchun, et al.
Pubblicazione: (2025)
Self-Improving Multilingual Long Reasoning via Translation-Reasoning Integrated Training
di: Liu, Junxiao, et al.
Pubblicazione: (2026)
di: Liu, Junxiao, et al.
Pubblicazione: (2026)
SDGO: Self-Discrimination-Guided Optimization for Consistent Safety in Large Language Models
di: Ding, Peng, et al.
Pubblicazione: (2025)
di: Ding, Peng, et al.
Pubblicazione: (2025)
Improving RL Exploration for LLM Reasoning through Retrospective Replay
di: Dou, Shihan, et al.
Pubblicazione: (2025)
di: Dou, Shihan, et al.
Pubblicazione: (2025)
B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners
di: Zeng, Weihao, et al.
Pubblicazione: (2024)
di: Zeng, Weihao, et al.
Pubblicazione: (2024)
Adapt to Thrive! Adaptive Power-Mean Policy Optimization for Improved LLM Reasoning
di: Huang, Yiming, et al.
Pubblicazione: (2026)
di: Huang, Yiming, et al.
Pubblicazione: (2026)
EnAnchored-X2X: English-Anchored Optimization for Many-to-Many Translation
di: Yang, Sen, et al.
Pubblicazione: (2025)
di: Yang, Sen, et al.
Pubblicazione: (2025)
DPEPO: Diverse Parallel Exploration Policy Optimization for LLM-based Agents
di: Zhang, Junshuo, et al.
Pubblicazione: (2026)
di: Zhang, Junshuo, et al.
Pubblicazione: (2026)
MoE-LPR: Multilingual Extension of Large Language Models through Mixture-of-Experts with Language Priors Routing
di: Zhou, Hao, et al.
Pubblicazione: (2024)
di: Zhou, Hao, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Measuring Meaning Composition in the Human Brain with Composition Scores from Large Language Models
di: Gao, Changjiang, et al.
Pubblicazione: (2024) -
Multilingual Pretraining and Instruction Tuning Improve Cross-Lingual Knowledge Alignment, But Only Shallowly
di: Gao, Changjiang, et al.
Pubblicazione: (2024) -
Could Thinking Multilingually Empower LLM Reasoning?
di: Gao, Changjiang, et al.
Pubblicazione: (2025) -
TAPO: Translation Augmented Policy Optimization for Multilingual Mathematical Reasoning
di: Huang, Xu, et al.
Pubblicazione: (2026) -
Large Language Models are Limited in Out-of-Context Knowledge Reasoning
di: Hu, Peng, et al.
Pubblicazione: (2024)