Guardado en:
| Autores principales: | Guo, Tianyu, Zhu, Hanlin, Zhang, Ruiqi, Jiao, Jiantao, Mei, Song, Jordan, Michael I., Russell, Stuart |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2502.13913 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Generalization or Hallucination? Understanding Out-of-Context Reasoning in Transformers
por: Huang, Yixiao, et al.
Publicado: (2025)
por: Huang, Yixiao, et al.
Publicado: (2025)
GSM-Agent: Understanding Agentic Reasoning Using Controllable Environments
por: Zhu, Hanlin, et al.
Publicado: (2025)
por: Zhu, Hanlin, et al.
Publicado: (2025)
Iterative Data Smoothing: Mitigating Reward Overfitting and Overoptimization in RLHF
por: Zhu, Banghua, et al.
Publicado: (2024)
por: Zhu, Banghua, et al.
Publicado: (2024)
Token Assorted: Mixing Latent and Text Tokens for Improved Language Model Reasoning
por: Su, DiJia, et al.
Publicado: (2025)
por: Su, DiJia, et al.
Publicado: (2025)
IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis
por: Li, Hanyu, et al.
Publicado: (2025)
por: Li, Hanyu, et al.
Publicado: (2025)
Lessons from Studying Two-Hop Latent Reasoning
por: Balesni, Mikita, et al.
Publicado: (2024)
por: Balesni, Mikita, et al.
Publicado: (2024)
GSM-Infinite: How Do Your LLMs Behave over Infinitely Increasing Context Length and Reasoning Complexity?
por: Zhou, Yang, et al.
Publicado: (2025)
por: Zhou, Yang, et al.
Publicado: (2025)
Towards a Theoretical Understanding of the 'Reversal Curse' via Training Dynamics
por: Zhu, Hanlin, et al.
Publicado: (2024)
por: Zhu, Hanlin, et al.
Publicado: (2024)
From Query to Logic: Ontology-Driven Multi-Hop Reasoning in LLMs
por: Bian, Haonan, et al.
Publicado: (2025)
por: Bian, Haonan, et al.
Publicado: (2025)
Thinking LLMs: General Instruction Following with Thought Generation
por: Wu, Tianhao, et al.
Publicado: (2024)
por: Wu, Tianhao, et al.
Publicado: (2024)
How Likely Do LLMs with CoT Mimic Human Reasoning?
por: Bao, Guangsheng, et al.
Publicado: (2024)
por: Bao, Guangsheng, et al.
Publicado: (2024)
Principled Reinforcement Learning with Human Feedback from Pairwise or $K$-wise Comparisons
por: Zhu, Banghua, et al.
Publicado: (2023)
por: Zhu, Banghua, et al.
Publicado: (2023)
How Do LLMs Use Their Depth?
por: Gupta, Akshat, et al.
Publicado: (2025)
por: Gupta, Akshat, et al.
Publicado: (2025)
How Do Answer Tokens Read Reasoning Traces? Self-Reading Patterns in Thinking LLMs for Quantitative Reasoning
por: Chen, Haoyang, et al.
Publicado: (2026)
por: Chen, Haoyang, et al.
Publicado: (2026)
Is Depth All You Need? An Exploration of Iterative Reasoning in LLMs
por: Wu, Zongqian, et al.
Publicado: (2025)
por: Wu, Zongqian, et al.
Publicado: (2025)
Reasoning Court: Combining Reasoning, Action, and Judgment for Multi-Hop Reasoning
por: Wu, Jingtian, et al.
Publicado: (2025)
por: Wu, Jingtian, et al.
Publicado: (2025)
Under the Shadow of Babel: How Language Shapes Reasoning in LLMs
por: Wang, Chenxi, et al.
Publicado: (2025)
por: Wang, Chenxi, et al.
Publicado: (2025)
What External Knowledge is Preferred by LLMs? Characterizing and Exploring Chain of Evidence in Imperfect Context for Multi-Hop QA
por: Chang, Zhiyuan, et al.
Publicado: (2024)
por: Chang, Zhiyuan, et al.
Publicado: (2024)
Hop, Skip, and Overthink: Diagnosing Why Reasoning Models Fumble during Multi-Hop Analysis
por: Yadav, Anushka, et al.
Publicado: (2025)
por: Yadav, Anushka, et al.
Publicado: (2025)
Avoiding Catastrophe in Online Learning by Asking for Help
por: Plaut, Benjamin, et al.
Publicado: (2024)
por: Plaut, Benjamin, et al.
Publicado: (2024)
HopChain: Multi-Hop Data Synthesis for Generalizable Vision-Language Reasoning
por: Wang, Shenzhi, et al.
Publicado: (2026)
por: Wang, Shenzhi, et al.
Publicado: (2026)
How Well Do LLMs Understand Tunisian Arabic?
por: Mahdi, Mohamed
Publicado: (2025)
por: Mahdi, Mohamed
Publicado: (2025)
How Do Latent Reasoning Methods Perform Under Weak and Strong Supervision?
por: Cui, Yingqian, et al.
Publicado: (2026)
por: Cui, Yingqian, et al.
Publicado: (2026)
Multi-Hop Reasoning for Question Answering with Hyperbolic Representations
por: Welz, Simon, et al.
Publicado: (2025)
por: Welz, Simon, et al.
Publicado: (2025)
Contextual Drag: How Errors in the Context Affect LLM Reasoning
por: Cheng, Yun, et al.
Publicado: (2026)
por: Cheng, Yun, et al.
Publicado: (2026)
Reasoning about Uncertainty: Do Reasoning Models Know When They Don't Know?
por: Mei, Zhiting, et al.
Publicado: (2025)
por: Mei, Zhiting, et al.
Publicado: (2025)
How to Evaluate Reward Models for RLHF
por: Frick, Evan, et al.
Publicado: (2024)
por: Frick, Evan, et al.
Publicado: (2024)
Negative Preference Optimization: From Catastrophic Collapse to Effective Unlearning
por: Zhang, Ruiqi, et al.
Publicado: (2024)
por: Zhang, Ruiqi, et al.
Publicado: (2024)
LLMs for Relational Reasoning: How Far are We?
por: Li, Zhiming, et al.
Publicado: (2024)
por: Li, Zhiming, et al.
Publicado: (2024)
Do LLMs Really Think Step-by-step In Implicit Reasoning?
por: Yu, Yijiong
Publicado: (2024)
por: Yu, Yijiong
Publicado: (2024)
ToxiLab: How Well Do Open-Source LLMs Generate Synthetic Toxicity Data?
por: Hui, Zheng, et al.
Publicado: (2024)
por: Hui, Zheng, et al.
Publicado: (2024)
CURIE: Evaluating LLMs On Multitask Scientific Long Context Understanding and Reasoning
por: Cui, Hao, et al.
Publicado: (2025)
por: Cui, Hao, et al.
Publicado: (2025)
Generative AI Security: Challenges and Countermeasures
por: Zhu, Banghua, et al.
Publicado: (2024)
por: Zhu, Banghua, et al.
Publicado: (2024)
How Reliable are LLMs for Reasoning on the Re-ranking task?
por: Islam, Nafis Tanveer, et al.
Publicado: (2025)
por: Islam, Nafis Tanveer, et al.
Publicado: (2025)
Efficient Prompt Caching via Embedding Similarity
por: Zhu, Hanlin, et al.
Publicado: (2024)
por: Zhu, Hanlin, et al.
Publicado: (2024)
CreDes: Causal Reasoning Enhancement and Dual-End Searching for Solving Long-Range Reasoning Problems using LLMs
por: Wang, Kangsheng, et al.
Publicado: (2024)
por: Wang, Kangsheng, et al.
Publicado: (2024)
What are the Essential Factors in Crafting Effective Long Context Multi-Hop Instruction Datasets? Insights and Best Practices
por: Chen, Zhi, et al.
Publicado: (2024)
por: Chen, Zhi, et al.
Publicado: (2024)
RELOOP: Recursive Retrieval with Multi-Hop Reasoner and Planners for Heterogeneous QA
por: Yang, Ruiyi, et al.
Publicado: (2025)
por: Yang, Ruiyi, et al.
Publicado: (2025)
KG-Reasoner: A Reinforced Model for End-to-End Multi-Hop Knowledge Graph Reasoning
por: Wang, Shuai, et al.
Publicado: (2026)
por: Wang, Shuai, et al.
Publicado: (2026)
HELMET: How to Evaluate Long-Context Language Models Effectively and Thoroughly
por: Yen, Howard, et al.
Publicado: (2024)
por: Yen, Howard, et al.
Publicado: (2024)
Ejemplares similares
-
Generalization or Hallucination? Understanding Out-of-Context Reasoning in Transformers
por: Huang, Yixiao, et al.
Publicado: (2025) -
GSM-Agent: Understanding Agentic Reasoning Using Controllable Environments
por: Zhu, Hanlin, et al.
Publicado: (2025) -
Iterative Data Smoothing: Mitigating Reward Overfitting and Overoptimization in RLHF
por: Zhu, Banghua, et al.
Publicado: (2024) -
Token Assorted: Mixing Latent and Text Tokens for Improved Language Model Reasoning
por: Su, DiJia, et al.
Publicado: (2025) -
IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis
por: Li, Hanyu, et al.
Publicado: (2025)