Interleaved Reasoning for Large Language Models via Reinforcement Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xie, Roy, Qiu, David, Gopinath, Deepak, Lin, Dong, Sun, Yanchao, Wang, Chong, Potdar, Saloni, Dhingra, Bhuwan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Over-Searching in Search-Augmented Large Language Models
par: Xie, Roy, et autres
Publié: (2026)
par: Xie, Roy, et autres
Publié: (2026)
Adversarial Math Word Problem Generation
par: Xie, Roy, et autres
Publié: (2024)
par: Xie, Roy, et autres
Publié: (2024)
Raccoon: Prompt Extraction Benchmark of LLM-Integrated Applications
par: Wang, Junlin, et autres
Publié: (2024)
par: Wang, Junlin, et autres
Publié: (2024)
Knowing When to Stop: Efficient Context Processing via Latent Sufficiency Signals
par: Xie, Roy, et autres
Publié: (2025)
par: Xie, Roy, et autres
Publié: (2025)
To Trust or Not to Trust? Enhancing Large Language Models' Situated Faithfulness to External Contexts
par: Huang, Yukun, et autres
Publié: (2024)
par: Huang, Yukun, et autres
Publié: (2024)
Leveraging the Power of Large Language Models in Entity Linking via Adaptive Routing and Targeted Reasoning
par: Li, Yajie, et autres
Publié: (2025)
par: Li, Yajie, et autres
Publié: (2025)
ChatShop: Interactive Information Seeking with Language Agents
par: Chen, Sanxing, et autres
Publié: (2024)
par: Chen, Sanxing, et autres
Publié: (2024)
GenEOL: Harnessing the Generative Power of LLMs for Training-Free Sentence Embeddings
par: Thirukovalluru, Raghuveer, et autres
Publié: (2024)
par: Thirukovalluru, Raghuveer, et autres
Publié: (2024)
RVPO: Risk-Sensitive Alignment via Variance Regularization
par: Montero, Ivan, et autres
Publié: (2026)
par: Montero, Ivan, et autres
Publié: (2026)
Calibrating Long-form Generations from Large Language Models
par: Huang, Yukun, et autres
Publié: (2024)
par: Huang, Yukun, et autres
Publié: (2024)
Cite Pretrain: Retrieval-Free Knowledge Attribution for Large Language Models
par: Huang, Yukun, et autres
Publié: (2025)
par: Huang, Yukun, et autres
Publié: (2025)
Automated Benchmark Auditing for AI Agents and Large Language Models
par: Wang, Junlin, et autres
Publié: (2026)
par: Wang, Junlin, et autres
Publié: (2026)
Atomic Self-Consistency for Better Long Form Generations
par: Thirukovalluru, Raghuveer, et autres
Publié: (2024)
par: Thirukovalluru, Raghuveer, et autres
Publié: (2024)
Do Large Language Models Have an English Accent? Evaluating and Improving the Naturalness of Multilingual LLMs
par: Guo, Yanzhu, et autres
Publié: (2024)
par: Guo, Yanzhu, et autres
Publié: (2024)
When Greedy Wins: Emergent Exploitation Bias in Meta-Bandit LLM Training
par: Chen, Sanxing, et autres
Publié: (2025)
par: Chen, Sanxing, et autres
Publié: (2025)
AgREE: Agentic Reasoning for Knowledge Graph Completion on Emerging Entities
par: Zhao, Ruochen, et autres
Publié: (2025)
par: Zhao, Ruochen, et autres
Publié: (2025)
Real-time Factuality Assessment from Adversarial Feedback
par: Chen, Sanxing, et autres
Publié: (2024)
par: Chen, Sanxing, et autres
Publié: (2024)
InData: Towards Secure Multi-Step, Tool-Based Data Analysis
par: K, Karthikeyan, et autres
Publié: (2025)
par: K, Karthikeyan, et autres
Publié: (2025)
Hierarchical Multi-Label Classification of Online Vaccine Concerns
par: Zhu, Chloe Qinyu, et autres
Publié: (2024)
par: Zhu, Chloe Qinyu, et autres
Publié: (2024)
ReCaLL: Membership Inference via Relative Conditional Log-Likelihoods
par: Xie, Roy, et autres
Publié: (2024)
par: Xie, Roy, et autres
Publié: (2024)
mRAKL: Multilingual Retrieval-Augmented Knowledge Graph Construction for Low-Resourced Languages
par: Nigatu, Hellina Hailu, et autres
Publié: (2025)
par: Nigatu, Hellina Hailu, et autres
Publié: (2025)
Coding Agents are Effective Long-Context Processors
par: Cao, Weili, et autres
Publié: (2026)
par: Cao, Weili, et autres
Publié: (2026)
Improving Model Alignment Through Collective Intelligence of Open-Source LLMS
par: Wang, Junlin, et autres
Publié: (2025)
par: Wang, Junlin, et autres
Publié: (2025)
CX-Mind: A Pioneering Multimodal Large Language Model for Interleaved Reasoning in Chest X-ray via Curriculum-Guided Reinforcement Learning
par: Li, Wenjie, et autres
Publié: (2025)
par: Li, Wenjie, et autres
Publié: (2025)
Atomic Consistency Preference Optimization for Long-Form Question Answering
par: Chen, Jingfeng, et autres
Publié: (2025)
par: Chen, Jingfeng, et autres
Publié: (2025)
Extracting Polymer Nanocomposite Samples from Full-Length Documents
par: Khalighinejad, Ghazal, et autres
Publié: (2024)
par: Khalighinejad, Ghazal, et autres
Publié: (2024)
A Platform for Investigating Public Health Content with Efficient Concern Classification
par: Li, Christopher, et autres
Publié: (2025)
par: Li, Christopher, et autres
Publié: (2025)
DS@GT at Touché: Large Language Models for Retrieval-Augmented Debate
par: Miyaguchi, Anthony, et autres
Publié: (2025)
par: Miyaguchi, Anthony, et autres
Publié: (2025)
Persona-Assigned Large Language Models Exhibit Human-Like Motivated Reasoning
par: Dash, Saloni, et autres
Publié: (2025)
par: Dash, Saloni, et autres
Publié: (2025)
Evaluating Morphological Compositional Generalization in Large Language Models
par: Ismayilzada, Mete, et autres
Publié: (2024)
par: Ismayilzada, Mete, et autres
Publié: (2024)
ConvKGYarn: Spinning Configurable and Scalable Conversational Knowledge Graph QA datasets with Large Language Models
par: Pradeep, Ronak, et autres
Publié: (2024)
par: Pradeep, Ronak, et autres
Publié: (2024)
DEEPAMBIGQA: Ambiguous Multi-hop Questions for Benchmarking LLM Answer Completeness
par: Ji, Jiabao, et autres
Publié: (2025)
par: Ji, Jiabao, et autres
Publié: (2025)
Generalizability of Large Language Model-Based Agents: A Comprehensive Survey
par: Zhang, Minxing, et autres
Publié: (2025)
par: Zhang, Minxing, et autres
Publié: (2025)
Document-as-Image Representations Fall Short for Scientific Retrieval
par: Khalighinejad, Ghazal, et autres
Publié: (2026)
par: Khalighinejad, Ghazal, et autres
Publié: (2026)
AGRaME: Any-Granularity Ranking with Multi-Vector Embeddings
par: Reddy, Revanth Gangi, et autres
Publié: (2024)
par: Reddy, Revanth Gangi, et autres
Publié: (2024)
Integrating Large Language Models and Reinforcement Learning for Non-Linear Reasoning
par: Alon, Yoav, et autres
Publié: (2024)
par: Alon, Yoav, et autres
Publié: (2024)
Interleaved Latent Visual Reasoning with Selective Perceptual Modeling
par: Dong, Shuai, et autres
Publié: (2025)
par: Dong, Shuai, et autres
Publié: (2025)
An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents
par: Jin, Bowen, et autres
Publié: (2025)
par: Jin, Bowen, et autres
Publié: (2025)
ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models
par: Liu, Mingjie, et autres
Publié: (2025)
par: Liu, Mingjie, et autres
Publié: (2025)
VEGA: Learning Interleaved Image-Text Comprehension in Vision-Language Large Models
par: Zhou, Chenyu, et autres
Publié: (2024)
par: Zhou, Chenyu, et autres
Publié: (2024)
Documents similaires
-
Over-Searching in Search-Augmented Large Language Models
par: Xie, Roy, et autres
Publié: (2026) -
Adversarial Math Word Problem Generation
par: Xie, Roy, et autres
Publié: (2024) -
Raccoon: Prompt Extraction Benchmark of LLM-Integrated Applications
par: Wang, Junlin, et autres
Publié: (2024) -
Knowing When to Stop: Efficient Context Processing via Latent Sufficiency Signals
par: Xie, Roy, et autres
Publié: (2025) -
To Trust or Not to Trust? Enhancing Large Language Models' Situated Faithfulness to External Contexts
par: Huang, Yukun, et autres
Publié: (2024)