Adaptive Test-Time Reasoning via Reward-Guided Dual-Phase Search
Fuente:
arXiv
Saved in:
| Main Authors: | Cui, Yingqian, Dai, Zhenwei, He, Pengfei, He, Bing, Liu, Hui, Tang, Xianfeng, Zeng, Jingying, Wang, Suhang, Xing, Yue, Tang, Jiliang, Dumoulin, Benoit |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Stepwise Perplexity-Guided Refinement for Efficient Chain-of-Thought Reasoning in Large Language Models
by: Cui, Yingqian, et al.
Published: (2025)
by: Cui, Yingqian, et al.
Published: (2025)
A Theoretical Understanding of Chain-of-Thought: Coherent Reasoning and Error-Aware Demonstration
by: Cui, Yingqian, et al.
Published: (2024)
by: Cui, Yingqian, et al.
Published: (2024)
How Do Latent Reasoning Methods Perform Under Weak and Strong Supervision?
by: Cui, Yingqian, et al.
Published: (2026)
by: Cui, Yingqian, et al.
Published: (2026)
TRAJECT-Bench:A Trajectory-Aware Benchmark for Evaluating Agentic Tool Use
by: He, Pengfei, et al.
Published: (2025)
by: He, Pengfei, et al.
Published: (2025)
To trust or not to trust: Attention-based Trust Management for LLM Multi-Agent Systems
by: He, Pengfei, et al.
Published: (2025)
by: He, Pengfei, et al.
Published: (2025)
Superiority of Multi-Head Attention in In-Context Linear Regression
by: Cui, Yingqian, et al.
Published: (2024)
by: Cui, Yingqian, et al.
Published: (2024)
How Far are LLMs from Real Search? A Comprehensive Study on Efficiency, Completeness, and Inherent Capabilities
by: Lin, Minhua, et al.
Published: (2025)
by: Lin, Minhua, et al.
Published: (2025)
A General Framework to Enhance Fine-tuning-based LLM Unlearning
by: Ren, Jie, et al.
Published: (2025)
by: Ren, Jie, et al.
Published: (2025)
Towards the Effect of Examples on In-Context Learning: A Theoretical Case Study
by: He, Pengfei, et al.
Published: (2024)
by: He, Pengfei, et al.
Published: (2024)
AgentTTS: Large Language Model Agent for Test-time Compute-optimal Scaling Strategy in Complex Tasks
by: Wang, Fali, et al.
Published: (2025)
by: Wang, Fali, et al.
Published: (2025)
Bradley-Terry and Multi-Objective Reward Modeling Are Complementary
by: Zhang, Zhiwei, et al.
Published: (2025)
by: Zhang, Zhiwei, et al.
Published: (2025)
DiffusionShield: A Watermark for Copyright Protection against Generative Diffusion Models
by: Cui, Yingqian, et al.
Published: (2023)
by: Cui, Yingqian, et al.
Published: (2023)
Stealthy Backdoor Attack via Confidence-driven Sampling
by: He, Pengfei, et al.
Published: (2023)
by: He, Pengfei, et al.
Published: (2023)
Keeping an Eye on LLM Unlearning: The Hidden Risk and Remedy
by: Ren, Jie, et al.
Published: (2025)
by: Ren, Jie, et al.
Published: (2025)
Cite Before You Speak: Enhancing Context-Response Grounding in E-commerce Conversational LLM-Agents
by: Zeng, Jingying, et al.
Published: (2025)
by: Zeng, Jingying, et al.
Published: (2025)
How Far Are LLMs from Professional Poker Players? Revisiting Game-Theoretic Reasoning with Agentic Tool Use
by: Lin, Minhua, et al.
Published: (2026)
by: Lin, Minhua, et al.
Published: (2026)
Retrieval Heads are Dynamic
by: Lin, Yuping, et al.
Published: (2026)
by: Lin, Yuping, et al.
Published: (2026)
Seeing but Not Believing: Probing the Disconnect Between Visual Attention and Answer Correctness in VLMs
by: Liu, Zhining, et al.
Published: (2025)
by: Liu, Zhining, et al.
Published: (2025)
Position: Agentic Evolution is the Path to Evolving LLMs
by: Lin, Minhua, et al.
Published: (2026)
by: Lin, Minhua, et al.
Published: (2026)
Multi-Faceted Studies on Data Poisoning can Advance LLM Development
by: He, Pengfei, et al.
Published: (2025)
by: He, Pengfei, et al.
Published: (2025)
Examples as the Prompt: A Scalable Approach for Efficient LLM Adaptation in E-Commerce
by: Zeng, Jingying, et al.
Published: (2025)
by: Zeng, Jingying, et al.
Published: (2025)
Unveiling Privacy Risks in LLM Agent Memory
by: Wang, Bo, et al.
Published: (2025)
by: Wang, Bo, et al.
Published: (2025)
Sharpness-Aware Data Poisoning Attack
by: He, Pengfei, et al.
Published: (2023)
by: He, Pengfei, et al.
Published: (2023)
FT-Shield: A Watermark Against Unauthorized Fine-tuning in Text-to-Image Diffusion Models
by: Cui, Yingqian, et al.
Published: (2023)
by: Cui, Yingqian, et al.
Published: (2023)
Learning with Less: Knowledge Distillation from Large Language Models via Unlabeled Data
by: Li, Juanhui, et al.
Published: (2024)
by: Li, Juanhui, et al.
Published: (2024)
Six-CD: Benchmarking Concept Removals for Benign Text-to-image Diffusion Models
by: Ren, Jie, et al.
Published: (2024)
by: Ren, Jie, et al.
Published: (2024)
Exploring Query Understanding for Amazon Product Search
by: Luo, Chen, et al.
Published: (2024)
by: Luo, Chen, et al.
Published: (2024)
Make LLMs better zero-shot reasoners: Structure-orientated autonomous reasoning
by: He, Pengfei, et al.
Published: (2024)
by: He, Pengfei, et al.
Published: (2024)
A Simple Plug-in for Improving Eviction-Based KV Cache Compression
by: Lin, Yuping, et al.
Published: (2026)
by: Lin, Yuping, et al.
Published: (2026)
Data Poisoning for In-context Learning
by: He, Pengfei, et al.
Published: (2024)
by: He, Pengfei, et al.
Published: (2024)
A Survey of Calibration Process for Black-Box LLMs
by: Xie, Liangru, et al.
Published: (2024)
by: Xie, Liangru, et al.
Published: (2024)
MemMA: Coordinating the Memory Cycle through Multi-Agent Reasoning and In-Situ Self-Evolution
by: Lin, Minhua, et al.
Published: (2026)
by: Lin, Minhua, et al.
Published: (2026)
Towards Understanding Jailbreak Attacks in LLMs: A Representation Space Analysis
by: Lin, Yuping, et al.
Published: (2024)
by: Lin, Yuping, et al.
Published: (2024)
Comprehensive Vulnerability Analysis is Necessary for Trustworthy LLM-MAS
by: He, Pengfei, et al.
Published: (2025)
by: He, Pengfei, et al.
Published: (2025)
Enhancing LLM Reasoning with Reward-guided Tree Search
by: Jiang, Jinhao, et al.
Published: (2024)
by: Jiang, Jinhao, et al.
Published: (2024)
Learning to Ponder: Adaptive Reasoning in Latent Space
by: He, Yixin, et al.
Published: (2025)
by: He, Yixin, et al.
Published: (2025)
Reasoning with Graphs: Structuring Implicit Knowledge to Enhance LLMs Reasoning
by: Han, Haoyu, et al.
Published: (2025)
by: Han, Haoyu, et al.
Published: (2025)
Divide-Verify-Refine: Can LLMs Self-Align with Complex Instructions?
by: Zhang, Xianren, et al.
Published: (2024)
by: Zhang, Xianren, et al.
Published: (2024)
Generalizing Test-time Compute-optimal Scaling as an Optimizable Graph
by: Wang, Fali, et al.
Published: (2025)
by: Wang, Fali, et al.
Published: (2025)
Crafting Reversible SFT Behaviors in Large Language Models
by: Lin, Yuping, et al.
Published: (2026)
by: Lin, Yuping, et al.
Published: (2026)
Similar Items
-
Stepwise Perplexity-Guided Refinement for Efficient Chain-of-Thought Reasoning in Large Language Models
by: Cui, Yingqian, et al.
Published: (2025) -
A Theoretical Understanding of Chain-of-Thought: Coherent Reasoning and Error-Aware Demonstration
by: Cui, Yingqian, et al.
Published: (2024) -
How Do Latent Reasoning Methods Perform Under Weak and Strong Supervision?
by: Cui, Yingqian, et al.
Published: (2026) -
TRAJECT-Bench:A Trajectory-Aware Benchmark for Evaluating Agentic Tool Use
by: He, Pengfei, et al.
Published: (2025) -
To trust or not to trust: Attention-based Trust Management for LLM Multi-Agent Systems
by: He, Pengfei, et al.
Published: (2025)