When to Vote, When to Rewrite: Disagreement-Guided Strategy Routing for Test-Time Scaling
Fuente:
arXiv
Salvato in:
| Autori principali: | Lin, Zhimin, Ji, Yixin, Li, Jinpeng, Luo, Yu, Li, Dong, Fang, Junhua, Li, Juntao, Zhang, Min |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
When Slower Isn't Truer: Inverse Scaling Law of Truthfulness in Multimodal Reasoning
di: Fang, Sitong, et al.
Pubblicazione: (2025)
di: Fang, Sitong, et al.
Pubblicazione: (2025)
Rethinking the Unsolvable: When In-Context Search Meets Test-Time Scaling
di: Xia, Fanzeng, et al.
Pubblicazione: (2025)
di: Xia, Fanzeng, et al.
Pubblicazione: (2025)
When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning
di: Xu, Ruotao, et al.
Pubblicazione: (2026)
di: Xu, Ruotao, et al.
Pubblicazione: (2026)
When the Majority is Wrong: Modeling Annotator Disagreement for Subjective Tasks
di: Fleisig, Eve, et al.
Pubblicazione: (2023)
di: Fleisig, Eve, et al.
Pubblicazione: (2023)
Inference-Time Scaling of Verification: Self-Evolving Deep Research Agents via Test-Time Rubric-Guided Verification
di: Wan, Yuxuan, et al.
Pubblicazione: (2026)
di: Wan, Yuxuan, et al.
Pubblicazione: (2026)
When More Thinking Hurts: Overthinking in LLM Test-Time Compute Scaling
di: Zhou, Shu, et al.
Pubblicazione: (2026)
di: Zhou, Shu, et al.
Pubblicazione: (2026)
From Multi-Agent to Single-Agent: When Is Skill Distillation Beneficial?
di: Xu, Binyan, et al.
Pubblicazione: (2026)
di: Xu, Binyan, et al.
Pubblicazione: (2026)
A Survey of Test-Time Compute: From Intuitive Inference to Deliberate Reasoning
di: Ji, Yixin, et al.
Pubblicazione: (2025)
di: Ji, Yixin, et al.
Pubblicazione: (2025)
Neurosymbolic LoRA: Why and When to Tune Weights vs. Rewrite Prompts
di: Wang, Kevin, et al.
Pubblicazione: (2026)
di: Wang, Kevin, et al.
Pubblicazione: (2026)
Learning When to Retrieve, What to Rewrite, and How to Respond in Conversational QA
di: Roy, Nirmal, et al.
Pubblicazione: (2024)
di: Roy, Nirmal, et al.
Pubblicazione: (2024)
The Majority Vote Paradigm Shift: When Popular Meets Optimal
di: Purificato, Antonio, et al.
Pubblicazione: (2025)
di: Purificato, Antonio, et al.
Pubblicazione: (2025)
Are We Scaling the Right Thing? A System Perspective on Test-Time Scaling
di: Zhao, Youpeng, et al.
Pubblicazione: (2025)
di: Zhao, Youpeng, et al.
Pubblicazione: (2025)
When Routing Collapses: On the Degenerate Convergence of LLM Routers
di: Lai, Guannan, et al.
Pubblicazione: (2026)
di: Lai, Guannan, et al.
Pubblicazione: (2026)
$\textbf{Re}^{2}$: Unlocking LLM Reasoning via Reinforcement Learning with Re-solving
di: Wang, Pinzheng, et al.
Pubblicazione: (2026)
di: Wang, Pinzheng, et al.
Pubblicazione: (2026)
When Single-Agent with Skills Replace Multi-Agent Systems and When They Fail
di: Li, Xiaoxiao
Pubblicazione: (2026)
di: Li, Xiaoxiao
Pubblicazione: (2026)
When Small Guides Large: Cross-Model Co-Learning for Test-Time Adaptation
di: Yi, Chang'an, et al.
Pubblicazione: (2025)
di: Yi, Chang'an, et al.
Pubblicazione: (2025)
When Adaptive Rewards Hurt: Causal Probing and the Switching-Stability Dilemma in LLM-Guided LEO Satellite Scheduling
di: Li, Yuanhang
Pubblicazione: (2026)
di: Li, Yuanhang
Pubblicazione: (2026)
Timely Machine: Awareness of Time Makes Test-Time Scaling Agentic
di: Ma, Yichuan, et al.
Pubblicazione: (2026)
di: Ma, Yichuan, et al.
Pubblicazione: (2026)
Mitigating Strategy-Selection Bias in Reasoning for More Effective Test-Time Scaling
di: Wu, Zongqian, et al.
Pubblicazione: (2025)
di: Wu, Zongqian, et al.
Pubblicazione: (2025)
Cognitive Decision Routing in Large Language Models: When to Think Fast, When to Think Slow
di: Du, Y., et al.
Pubblicazione: (2025)
di: Du, Y., et al.
Pubblicazione: (2025)
What and When to Distill: Selective Hindsight Distillation for Multi-Turn Agents
di: Li, Xiaozhe, et al.
Pubblicazione: (2026)
di: Li, Xiaozhe, et al.
Pubblicazione: (2026)
When Fewer Layers Break More Chains: Layer Pruning Harms Test-Time Scaling in LLMs
di: Wang, Keyu, et al.
Pubblicazione: (2025)
di: Wang, Keyu, et al.
Pubblicazione: (2025)
Efficient Test-Time Scaling via Temporal Reasoning Aggregation
di: Li, Jiakun, et al.
Pubblicazione: (2026)
di: Li, Jiakun, et al.
Pubblicazione: (2026)
MemReread: Enhancing Agentic Long-Context Reasoning via Memory-Guided Rereading
di: Ji, Baibei, et al.
Pubblicazione: (2026)
di: Ji, Baibei, et al.
Pubblicazione: (2026)
Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence
di: Ghasemabadi, Amirhosein, et al.
Pubblicazione: (2025)
di: Ghasemabadi, Amirhosein, et al.
Pubblicazione: (2025)
Learning When to Plan: Efficiently Allocating Test-Time Compute for LLM Agents
di: Paglieri, Davide, et al.
Pubblicazione: (2025)
di: Paglieri, Davide, et al.
Pubblicazione: (2025)
When Grammar Guides the Attack: Uncovering Control-Plane Vulnerabilities in LLMs with Structured Output
di: Zhang, Shuoming, et al.
Pubblicazione: (2025)
di: Zhang, Shuoming, et al.
Pubblicazione: (2025)
Useful Memories Become Faulty When Continuously Updated by LLMs
di: Zhang, Dylan, et al.
Pubblicazione: (2026)
di: Zhang, Dylan, et al.
Pubblicazione: (2026)
Modality-Guided Mixture of Graph Experts with Entropy-Triggered Routing for Multimodal Recommendation
di: Dai, Ji, et al.
Pubblicazione: (2026)
di: Dai, Ji, et al.
Pubblicazione: (2026)
Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning
di: Li, Ang, et al.
Pubblicazione: (2025)
di: Li, Ang, et al.
Pubblicazione: (2025)
When Precedents Clash
di: Di Florio, Cecilia, et al.
Pubblicazione: (2024)
di: Di Florio, Cecilia, et al.
Pubblicazione: (2024)
Rethinking the Role of Prompting Strategies in LLM Test-Time Scaling: A Perspective of Probability Theory
di: Liu, Yexiang, et al.
Pubblicazione: (2025)
di: Liu, Yexiang, et al.
Pubblicazione: (2025)
When and How Much to Imagine: Adaptive Test-Time Scaling with World Models for Visual Spatial Reasoning
di: Yu, Shoubin, et al.
Pubblicazione: (2026)
di: Yu, Shoubin, et al.
Pubblicazione: (2026)
When (and How) to Trust the Expert: Diagnosing Query-Time Expert-Guided Reinforcement Learning
di: Berthelot, Yann, et al.
Pubblicazione: (2026)
di: Berthelot, Yann, et al.
Pubblicazione: (2026)
VerilogReader: LLM-Aided Hardware Test Generation
di: Ma, Ruiyang, et al.
Pubblicazione: (2024)
di: Ma, Ruiyang, et al.
Pubblicazione: (2024)
Revealing Weaknesses in Text Watermarking Through Self-Information Rewrite Attacks
di: Cheng, Yixin, et al.
Pubblicazione: (2025)
di: Cheng, Yixin, et al.
Pubblicazione: (2025)
When, What, and How: Rethinking Retrieval-Enhanced Speculative Decoding
di: Fang, Min, et al.
Pubblicazione: (2025)
di: Fang, Min, et al.
Pubblicazione: (2025)
When Normality Shifts: Risk-Aware Test-Time Adaptation for Unsupervised Tabular Anomaly Detection
di: Huang, Wei, et al.
Pubblicazione: (2026)
di: Huang, Wei, et al.
Pubblicazione: (2026)
When Right Meets Wrong: Bilateral Context Conditioning with Reward-Confidence Correction for GRPO
di: Li, Yu, et al.
Pubblicazione: (2026)
di: Li, Yu, et al.
Pubblicazione: (2026)
When Models Know When They Do Not Know: Calibration, Cascading, and Cleaning
di: Hao, Chenjie, et al.
Pubblicazione: (2026)
di: Hao, Chenjie, et al.
Pubblicazione: (2026)
Documenti analoghi
-
When Slower Isn't Truer: Inverse Scaling Law of Truthfulness in Multimodal Reasoning
di: Fang, Sitong, et al.
Pubblicazione: (2025) -
Rethinking the Unsolvable: When In-Context Search Meets Test-Time Scaling
di: Xia, Fanzeng, et al.
Pubblicazione: (2025) -
When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning
di: Xu, Ruotao, et al.
Pubblicazione: (2026) -
When the Majority is Wrong: Modeling Annotator Disagreement for Subjective Tasks
di: Fleisig, Eve, et al.
Pubblicazione: (2023) -
Inference-Time Scaling of Verification: Self-Evolving Deep Research Agents via Test-Time Rubric-Guided Verification
di: Wan, Yuxuan, et al.
Pubblicazione: (2026)