Guardado en:
| Autores principales: | He, Kaiyu, Wu, Peilin, Zhang, Mian, Wan, Kun, Zhao, Wentian, Du, Xinya, Chen, Zhiyu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2509.24096 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
HiPRAG: Hierarchical Process Rewards for Efficient Agentic Retrieval Augmented Generation
por: Wu, Peilin, et al.
Publicado: (2025)
por: Wu, Peilin, et al.
Publicado: (2025)
AMARIS: A Memory-Augmented Rubric Improvement System for Rubric-Based Reinforcement Learning
por: Wu, Peilin, et al.
Publicado: (2026)
por: Wu, Peilin, et al.
Publicado: (2026)
Is Grokking Worthwhile? Functional Analysis and Transferability of Generalization Circuits in Transformers
por: He, Kaiyu, et al.
Publicado: (2026)
por: He, Kaiyu, et al.
Publicado: (2026)
Do Retrieval-Augmented Language Models Adapt to Varying User Needs?
por: Wu, Peilin, et al.
Publicado: (2025)
por: Wu, Peilin, et al.
Publicado: (2025)
Search Wisely: Mitigating Sub-optimal Agentic Searches By Reducing Uncertainty
por: Wu, Peilin, et al.
Publicado: (2025)
por: Wu, Peilin, et al.
Publicado: (2025)
IDEA: Enhancing the Rule Learning Ability of Large Language Model Agent through Induction, Deduction, and Abduction
por: He, Kaiyu, et al.
Publicado: (2024)
por: He, Kaiyu, et al.
Publicado: (2024)
NeSTR: A Neuro-Symbolic Abductive Framework for Temporal Reasoning in Large Language Models
por: Liang, Feng, et al.
Publicado: (2025)
por: Liang, Feng, et al.
Publicado: (2025)
GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM
por: Kang, Hao, et al.
Publicado: (2024)
por: Kang, Hao, et al.
Publicado: (2024)
GEAR: Granularity-Adaptive Advantage Reweighting for LLM Agents via Self-Distillation
por: Li, Sijia, et al.
Publicado: (2026)
por: Li, Sijia, et al.
Publicado: (2026)
From Reasoning to Learning: A Survey on Hypothesis Discovery and Rule Learning with Large Language Models
por: He, Kaiyu, et al.
Publicado: (2025)
por: He, Kaiyu, et al.
Publicado: (2025)
MLR-Copilot: Autonomous Machine Learning Research based on Large Language Models Agents
por: Li, Ruochen, et al.
Publicado: (2024)
por: Li, Ruochen, et al.
Publicado: (2024)
Representational Homomorphism Predicts and Improves Compositional Generalization In Transformer Language Model
por: An, Zhiyu, et al.
Publicado: (2026)
por: An, Zhiyu, et al.
Publicado: (2026)
MMLU-SR: A Benchmark for Stress-Testing Reasoning Capability of Large Language Models
por: Wang, Wentian, et al.
Publicado: (2024)
por: Wang, Wentian, et al.
Publicado: (2024)
RLAC: Reinforcement Learning with Adversarial Critic for Free-Form Generation Tasks
por: Wu, Mian, et al.
Publicado: (2025)
por: Wu, Mian, et al.
Publicado: (2025)
Efficient Self-Improvement in Multimodal Large Language Models: A Model-Level Judge-Free Approach
por: Deng, Shijian, et al.
Publicado: (2024)
por: Deng, Shijian, et al.
Publicado: (2024)
When Does Multi-Agent RL Improve LLM Workflows? Workflow, Scale, and Policy-Sharing Tradeoffs
por: Zeng, Yifan, et al.
Publicado: (2026)
por: Zeng, Yifan, et al.
Publicado: (2026)
On Designing Effective RL Reward at Training Time for LLM Reasoning
por: Gao, Jiaxuan, et al.
Publicado: (2024)
por: Gao, Jiaxuan, et al.
Publicado: (2024)
Open Problems in Differentiable Social Choice: Learning Mechanisms, Decisions, and Alignment
por: An, Zhiyu, et al.
Publicado: (2026)
por: An, Zhiyu, et al.
Publicado: (2026)
Specialised or Generic? Tokenization Choices for Radiology Language Models
por: Warr, Hermione, et al.
Publicado: (2025)
por: Warr, Hermione, et al.
Publicado: (2025)
Evaluation is All You Need: Strategic Overclaiming of LLM Reasoning Capabilities Through Evaluation Design
por: Sun, Lin, et al.
Publicado: (2025)
por: Sun, Lin, et al.
Publicado: (2025)
LogQuant: Log-Distributed 2-Bit Quantization of KV Cache with Superior Accuracy Preservation
por: Chen, Han, et al.
Publicado: (2025)
por: Chen, Han, et al.
Publicado: (2025)
Genius: A Generalizable and Purely Unsupervised Self-Training Framework For Advanced Reasoning
por: Xu, Fangzhi, et al.
Publicado: (2025)
por: Xu, Fangzhi, et al.
Publicado: (2025)
Foundational Automatic Evaluators: Scaling Multi-Task Generative Evaluator Training for Reasoning-Centric Domains
por: Xu, Austin, et al.
Publicado: (2025)
por: Xu, Austin, et al.
Publicado: (2025)
Reasoning-Driven Synthetic Data Generation and Evaluation
por: Davidson, Tim R., et al.
Publicado: (2026)
por: Davidson, Tim R., et al.
Publicado: (2026)
SABER: Switchable and Balanced Training for Efficient LLM Reasoning
por: Zhao, Kai, et al.
Publicado: (2025)
por: Zhao, Kai, et al.
Publicado: (2025)
PhantomWiki: On-Demand Datasets for Reasoning and Retrieval Evaluation
por: Gong, Albert, et al.
Publicado: (2025)
por: Gong, Albert, et al.
Publicado: (2025)
StepFun-Formalizer: Unlocking the Autoformalization Potential of LLMs through Knowledge-Reasoning Fusion
por: Wu, Yutong, et al.
Publicado: (2025)
por: Wu, Yutong, et al.
Publicado: (2025)
Titans: Learning to Memorize at Test Time
por: Behrouz, Ali, et al.
Publicado: (2024)
por: Behrouz, Ali, et al.
Publicado: (2024)
Large Language Model Cascades with Mixture of Thoughts Representations for Cost-efficient Reasoning
por: Yue, Murong, et al.
Publicado: (2023)
por: Yue, Murong, et al.
Publicado: (2023)
Generative Evaluation of Complex Reasoning in Large Language Models
por: Lin, Haowei, et al.
Publicado: (2025)
por: Lin, Haowei, et al.
Publicado: (2025)
DeduCE: Deductive Consistency as a Framework to Evaluate LLM Reasoning
por: Pandey, Atharva, et al.
Publicado: (2025)
por: Pandey, Atharva, et al.
Publicado: (2025)
TTSR: Test-Time Self-Reflection for Continual Reasoning Improvement
por: He, Haoyang, et al.
Publicado: (2026)
por: He, Haoyang, et al.
Publicado: (2026)
KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation
por: Shi, Jiajun, et al.
Publicado: (2025)
por: Shi, Jiajun, et al.
Publicado: (2025)
Reasoning through Exploration: A Reinforcement Learning Framework for Robust Function Calling
por: Hao, Bingguang, et al.
Publicado: (2025)
por: Hao, Bingguang, et al.
Publicado: (2025)
Efficient Rectification of Neuro-Symbolic Reasoning Inconsistencies by Abductive Reflection
por: Hu, Wen-Chao, et al.
Publicado: (2024)
por: Hu, Wen-Chao, et al.
Publicado: (2024)
Scaling Reasoning without Attention
por: Zhao, Xueliang, et al.
Publicado: (2025)
por: Zhao, Xueliang, et al.
Publicado: (2025)
Beyond Noisy-TVs: Noise-Robust Exploration Via Learning Progress Monitoring
por: Hou, Zhibo, et al.
Publicado: (2025)
por: Hou, Zhibo, et al.
Publicado: (2025)
Speculative Decoding Meets Quantization: Compatibility Evaluation and Hierarchical Framework Design
por: Zhang, Yudi, et al.
Publicado: (2025)
por: Zhang, Yudi, et al.
Publicado: (2025)
Principled Data Selection for Alignment: The Hidden Risks of Difficult Examples
por: Gao, Chengqian, et al.
Publicado: (2025)
por: Gao, Chengqian, et al.
Publicado: (2025)
ModelGPT: Unleashing LLM's Capabilities for Tailored Model Generation
por: Tang, Zihao, et al.
Publicado: (2024)
por: Tang, Zihao, et al.
Publicado: (2024)
Ejemplares similares
-
HiPRAG: Hierarchical Process Rewards for Efficient Agentic Retrieval Augmented Generation
por: Wu, Peilin, et al.
Publicado: (2025) -
AMARIS: A Memory-Augmented Rubric Improvement System for Rubric-Based Reinforcement Learning
por: Wu, Peilin, et al.
Publicado: (2026) -
Is Grokking Worthwhile? Functional Analysis and Transferability of Generalization Circuits in Transformers
por: He, Kaiyu, et al.
Publicado: (2026) -
Do Retrieval-Augmented Language Models Adapt to Varying User Needs?
por: Wu, Peilin, et al.
Publicado: (2025) -
Search Wisely: Mitigating Sub-optimal Agentic Searches By Reducing Uncertainty
por: Wu, Peilin, et al.
Publicado: (2025)