Inference-Time Scaling for Complex Tasks: Where We Stand and What Lies Ahead
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Balachandran, Vidhisha, Chen, Jingya, Chen, Lingjiao, Garg, Shivam, Joshi, Neel, Lara, Yash, Langford, John, Nushi, Besmira, Vineet, Vibhav, Wu, Yue, Yousefi, Safoora |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Eureka: Evaluating and Understanding Large Foundation Models
par: Balachandran, Vidhisha, et autres
Publié: (2024)
par: Balachandran, Vidhisha, et autres
Publié: (2024)
Unearthing Skill-Level Insights for Understanding Trade-Offs of Foundation Models
par: Moayeri, Mazda, et autres
Publié: (2024)
par: Moayeri, Mazda, et autres
Publié: (2024)
Improving Instruction-Following in Language Models through Activation Steering
par: Stolfo, Alessandro, et autres
Publié: (2024)
par: Stolfo, Alessandro, et autres
Publié: (2024)
MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation
par: Joshi, Siddharth, et autres
Publié: (2025)
par: Joshi, Siddharth, et autres
Publié: (2025)
Tracing the Traces: Latent Temporal Signals for Efficient and Accurate Reasoning
par: Vilas, Martina G., et autres
Publié: (2025)
par: Vilas, Martina G., et autres
Publié: (2025)
BenchAgents: Multi-Agent Systems for Structured Benchmark Creation
par: Butt, Natasha, et autres
Publié: (2024)
par: Butt, Natasha, et autres
Publié: (2024)
Just Do It!? Computer-Use Agents Exhibit Blind Goal-Directedness
par: Shayegani, Erfan, et autres
Publié: (2025)
par: Shayegani, Erfan, et autres
Publié: (2025)
Phi-4-reasoning Technical Report
par: Abdin, Marah, et autres
Publié: (2025)
par: Abdin, Marah, et autres
Publié: (2025)
ZEBRAARENA: A Diagnostic Simulation Environment for Studying Reasoning-Action Coupling in Tool-Augmented LLMs
par: Zhao, Wanjia, et autres
Publié: (2026)
par: Zhao, Wanjia, et autres
Publié: (2026)
What MLLMs Learn about When they Learn about Multimodal Reasoning
par: Chung, Jiwan, et autres
Publié: (2025)
par: Chung, Jiwan, et autres
Publié: (2025)
Attention Speaks Volumes: Localizing and Mitigating Bias in Language Models
par: Adiga, Rishabh, et autres
Publié: (2024)
par: Adiga, Rishabh, et autres
Publié: (2024)
Sample More to Think Less: Group Filtered Policy Optimization for Concise Reasoning
par: Shrivastava, Vaishnavi, et autres
Publié: (2025)
par: Shrivastava, Vaishnavi, et autres
Publié: (2025)
Understanding Depth and Height Perception in Large Visual-Language Models
par: Azad, Shehreen, et autres
Publié: (2024)
par: Azad, Shehreen, et autres
Publié: (2024)
LogiPlan: A Structured Benchmark for Logical Planning and Relational Reasoning in LLMs
par: Cai, Yanan, et autres
Publié: (2025)
par: Cai, Yanan, et autres
Publié: (2025)
PEEKABOO: Interactive Video Generation via Masked-Diffusion
par: Jain, Yash, et autres
Publié: (2023)
par: Jain, Yash, et autres
Publié: (2023)
StreamReady: Learning What to Answer and When in Long Streaming Videos
par: Azad, Shehreen, et autres
Publié: (2026)
par: Azad, Shehreen, et autres
Publié: (2026)
Is A Picture Worth A Thousand Words? Delving Into Spatial Reasoning for Vision Language Models
par: Wang, Jiayu, et autres
Publié: (2024)
par: Wang, Jiayu, et autres
Publié: (2024)
Physics Knowledge in Frontier Models: A Diagnostic Study of Failure Modes
par: Bagdonaviciute, Ieva, et autres
Publié: (2025)
par: Bagdonaviciute, Ieva, et autres
Publié: (2025)
Quantum Computing in Industrial Environments: Where Do We Stand and Where Are We Headed?
par: Osaba, Eneko, et autres
Publié: (2025)
par: Osaba, Eneko, et autres
Publié: (2025)
Elephants Never Forget: Memorization and Learning of Tabular Data in Large Language Models
par: Bordt, Sebastian, et autres
Publié: (2024)
par: Bordt, Sebastian, et autres
Publié: (2024)
Detecting Data Contamination in LLMs via In-Context Learning
par: Zawalski, Michał, et autres
Publié: (2025)
par: Zawalski, Michał, et autres
Publié: (2025)
Diversity of Thought Improves Reasoning Abilities of LLMs
par: Naik, Ranjita, et autres
Publié: (2023)
par: Naik, Ranjita, et autres
Publié: (2023)
MEMENTO: Teaching LLMs to Manage Their Own Context
par: Kontonis, Vasilis, et autres
Publié: (2026)
par: Kontonis, Vasilis, et autres
Publié: (2026)
Modelling Photocatalytic N2 Reduction to Ammonia: Where We Stand and Where We Are Going
par: Taja Žibert, et autres
Publié: (2024)
par: Taja Žibert, et autres
Publié: (2024)
Test-time Prompt Refinement for Text-to-Image Models
par: Khan, Mohammad Abdul Hafeez, et autres
Publié: (2025)
par: Khan, Mohammad Abdul Hafeez, et autres
Publié: (2025)
RiTTA: Modeling Event Relations in Text-to-Audio Generation
par: He, Yuhang, et autres
Publié: (2024)
par: He, Yuhang, et autres
Publié: (2024)
Intestinal and Multivisceral Transplantation: Where We Stand Today
par: Mohamed Maklad, et autres
Publié: (2026)
par: Mohamed Maklad, et autres
Publié: (2026)
Diagnosing Breastfeeding Difficulties: Where Do We Stand?
par: Laura Galante, et autres
Publié: (2025)
par: Laura Galante, et autres
Publié: (2025)
OCLC, Libraries, and Scholarship: What Lies Ahead?
par: Holley, Edward G.
Publié: (1989)
par: Holley, Edward G.
Publié: (1989)
Crisis in the Strait of Hormuz: What Lies Ahead?
par: Gawdat Bahgat
Publié: (2026)
par: Gawdat Bahgat
Publié: (2026)
Cavity Detection of Gravitational Waves: Where Do We Stand?
par: Gatti, Claudio, et autres
Publié: (2024)
par: Gatti, Claudio, et autres
Publié: (2024)
School - Public Library Relations: Where Do We Stand?
Publié: (1969)
Publié: (1969)
Values and Where We Stand as Private School and Public Librarians.
par: Bingham, Rebecca T.
Publié: (1982)
par: Bingham, Rebecca T.
Publié: (1982)
Biomarkers of Lupus Nephritis Histopathology: Where Do We Stand?
par: Valentina Querin, et autres
Publié: (2026)
par: Valentina Querin, et autres
Publié: (2026)
Understanding Information Storage and Transfer in Multi-modal Large Language Models
par: Basu, Samyadeep, et autres
Publié: (2024)
par: Basu, Samyadeep, et autres
Publié: (2024)
What Kind of Librarians Do We Need in the Future? Youth Services Librarians!
par: Parikh, Neel
Publié: (2000)
par: Parikh, Neel
Publié: (2000)
A Review on Improving PSC Performance through Charge Carrier Management: Where We Stand and What's Next?
par: Nematov, Dilshod
Publié: (2025)
par: Nematov, Dilshod
Publié: (2025)
Navigating Hallucinations for Reasoning of Unintentional Activities
par: Grover, Shresth, et autres
Publié: (2024)
par: Grover, Shresth, et autres
Publié: (2024)
Exposing the Achilles' Heel: Evaluating LLMs Ability to Handle Mistakes in Mathematical Reasoning
par: Singh, Joykirat, et autres
Publié: (2024)
par: Singh, Joykirat, et autres
Publié: (2024)
Bayesian Optimization in Bioprocess Engineering—Where Do We Stand Today?
par: Florian Gisperg, et autres
Publié: (2025)
par: Florian Gisperg, et autres
Publié: (2025)
Documents similaires
-
Eureka: Evaluating and Understanding Large Foundation Models
par: Balachandran, Vidhisha, et autres
Publié: (2024) -
Unearthing Skill-Level Insights for Understanding Trade-Offs of Foundation Models
par: Moayeri, Mazda, et autres
Publié: (2024) -
Improving Instruction-Following in Language Models through Activation Steering
par: Stolfo, Alessandro, et autres
Publié: (2024) -
MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation
par: Joshi, Siddharth, et autres
Publié: (2025) -
Tracing the Traces: Latent Temporal Signals for Efficient and Accurate Reasoning
par: Vilas, Martina G., et autres
Publié: (2025)