Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction
Fuente:
arXiv
Salvato in:
| Autori principali: | Shen, Junhong, Bai, Hao, Zhang, Lunjun, Zhou, Yifei, Setlur, Amrith, Tong, Shengbang, Caples, Diego, Jiang, Nan, Zhang, Tong, Talwalkar, Ameet, Kumar, Aviral |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Scaling Test-Time Compute Without Verification or RL is Suboptimal
di: Setlur, Amrith, et al.
Pubblicazione: (2025)
di: Setlur, Amrith, et al.
Pubblicazione: (2025)
Reasoning Cache: Continual Improvement Over Long Horizons via Short-Horizon RL
di: Wu, Ian, et al.
Pubblicazione: (2026)
di: Wu, Ian, et al.
Pubblicazione: (2026)
Multitask Learning Can Improve Worst-Group Outcomes
di: Kulkarni, Atharva, et al.
Pubblicazione: (2023)
di: Kulkarni, Atharva, et al.
Pubblicazione: (2023)
UPS: Efficiently Building Foundation Models for PDE Solving via Cross-Modal Adaptation
di: Shen, Junhong, et al.
Pubblicazione: (2024)
di: Shen, Junhong, et al.
Pubblicazione: (2024)
RL on Incorrect Synthetic Data Scales the Efficiency of LLM Math Reasoning by Eight-Fold
di: Setlur, Amrith, et al.
Pubblicazione: (2024)
di: Setlur, Amrith, et al.
Pubblicazione: (2024)
POPE: Learning to Reason on Hard Problems via Privileged On-Policy Exploration
di: Qu, Yuxiao, et al.
Pubblicazione: (2026)
di: Qu, Yuxiao, et al.
Pubblicazione: (2026)
What Do Learning Dynamics Reveal About Generalization in LLM Reasoning?
di: Kang, Katie, et al.
Pubblicazione: (2024)
di: Kang, Katie, et al.
Pubblicazione: (2024)
InT: Self-Proposed Interventions Enable Credit Assignment in LLM Reasoning
di: Yang, Matthew Y. R., et al.
Pubblicazione: (2026)
di: Yang, Matthew Y. R., et al.
Pubblicazione: (2026)
ScribeAgent: Towards Specialized Web Agents Using Production-Scale Workflow Data
di: Shen, Junhong, et al.
Pubblicazione: (2024)
di: Shen, Junhong, et al.
Pubblicazione: (2024)
RLAD: Training LLMs to Discover Abstractions for Solving Reasoning Problems
di: Qu, Yuxiao, et al.
Pubblicazione: (2025)
di: Qu, Yuxiao, et al.
Pubblicazione: (2025)
Rewarding Progress: Scaling Automated Process Verifiers for LLM Reasoning
di: Setlur, Amrith, et al.
Pubblicazione: (2024)
di: Setlur, Amrith, et al.
Pubblicazione: (2024)
WebGym: Scaling Training Environments for Visual Web Agents with Realistic Tasks
di: Bai, Hao, et al.
Pubblicazione: (2026)
di: Bai, Hao, et al.
Pubblicazione: (2026)
The Impact of Element Ordering on LM Agent Performance
di: Chi, Wayne, et al.
Pubblicazione: (2024)
di: Chi, Wayne, et al.
Pubblicazione: (2024)
RECODE: Reasoning Through Code Generation for Visual Question Answering
di: Shen, Junhong, et al.
Pubblicazione: (2025)
di: Shen, Junhong, et al.
Pubblicazione: (2025)
Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning
di: Qu, Yuxiao, et al.
Pubblicazione: (2025)
di: Qu, Yuxiao, et al.
Pubblicazione: (2025)
e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs
di: Setlur, Amrith, et al.
Pubblicazione: (2025)
di: Setlur, Amrith, et al.
Pubblicazione: (2025)
Specialized Foundation Models Struggle to Beat Supervised Baselines
di: Xu, Zongzhe, et al.
Pubblicazione: (2024)
di: Xu, Zongzhe, et al.
Pubblicazione: (2024)
Lower Bounds for Public-Private Learning under Distribution Shift
di: Setlur, Amrith, et al.
Pubblicazione: (2025)
di: Setlur, Amrith, et al.
Pubblicazione: (2025)
Why Do Decision Makers (Not) Use AI? A Cross-Domain Analysis of Factors Impacting AI Adoption
di: Yu, Rebecca, et al.
Pubblicazione: (2025)
di: Yu, Rebecca, et al.
Pubblicazione: (2025)
CodePDE: An Inference Framework for LLM-driven PDE Solver Generation
di: Li, Shanda, et al.
Pubblicazione: (2025)
di: Li, Shanda, et al.
Pubblicazione: (2025)
Exact Unlearning of Finetuning Data via Model Merging at Scale
di: Kuo, Kevin, et al.
Pubblicazione: (2025)
di: Kuo, Kevin, et al.
Pubblicazione: (2025)
Connecting Joint-Embedding Predictive Architecture with Contrastive Self-supervised Learning
di: Mo, Shentong, et al.
Pubblicazione: (2024)
di: Mo, Shentong, et al.
Pubblicazione: (2024)
CoMind: Towards Community-Driven Agents for Machine Learning Engineering
di: Li, Sijie, et al.
Pubblicazione: (2025)
di: Li, Sijie, et al.
Pubblicazione: (2025)
Generative Verifiers: Reward Modeling as Next-Token Prediction
di: Zhang, Lunjun, et al.
Pubblicazione: (2024)
di: Zhang, Lunjun, et al.
Pubblicazione: (2024)
Deep Neural Networks Tend To Extrapolate Predictably
di: Kang, Katie, et al.
Pubblicazione: (2023)
di: Kang, Katie, et al.
Pubblicazione: (2023)
FrontierCO: Real-World and Large-Scale Evaluation of Machine Learning Solvers for Combinatorial Optimization
di: Feng, Shengyu, et al.
Pubblicazione: (2025)
di: Feng, Shengyu, et al.
Pubblicazione: (2025)
Do LLMs exhibit human-like response biases? A case study in survey design
di: Tjuatja, Lindia, et al.
Pubblicazione: (2023)
di: Tjuatja, Lindia, et al.
Pubblicazione: (2023)
QED-Nano: Teaching a Tiny Model to Prove Hard Theorems
di: LM-Provers, et al.
Pubblicazione: (2026)
di: LM-Provers, et al.
Pubblicazione: (2026)
Reuse your FLOPs: Scaling RL on Hard Problems by Conditioning on Very Off-Policy Prefixes
di: Setlur, Amrith, et al.
Pubblicazione: (2026)
di: Setlur, Amrith, et al.
Pubblicazione: (2026)
Sample Complexity and Representation Ability of Test-time Scaling Paradigms
di: Huang, Baihe, et al.
Pubblicazione: (2025)
di: Huang, Baihe, et al.
Pubblicazione: (2025)
Code with Me or for Me? How Increasing AI Automation Transforms Developer Workflows
di: Chen, Valerie, et al.
Pubblicazione: (2025)
di: Chen, Valerie, et al.
Pubblicazione: (2025)
Agreement-Based Cascading for Efficient Inference
di: Kolawole, Steven, et al.
Pubblicazione: (2024)
di: Kolawole, Steven, et al.
Pubblicazione: (2024)
On the Benefits of Public Representations for Private Transfer Learning under Distribution Shift
di: Thaker, Pratiksha, et al.
Pubblicazione: (2023)
di: Thaker, Pratiksha, et al.
Pubblicazione: (2023)
When Benchmarks Talk: Re-Evaluating Code LLMs with Interactive Feedback
di: Pan, Jane, et al.
Pubblicazione: (2025)
di: Pan, Jane, et al.
Pubblicazione: (2025)
Digi-Q: Learning Q-Value Functions for Training Device-Control Agents
di: Bai, Hao, et al.
Pubblicazione: (2025)
di: Bai, Hao, et al.
Pubblicazione: (2025)
From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models
di: Fang, Irving, et al.
Pubblicazione: (2025)
di: Fang, Irving, et al.
Pubblicazione: (2025)
Mass-Producing Failures of Multimodal Systems with Language Models
di: Tong, Shengbang, et al.
Pubblicazione: (2023)
di: Tong, Shengbang, et al.
Pubblicazione: (2023)
Spend Less, Fit Better: Budget-Efficient Scaling Law Fitting via Active Experiment Selection
di: Li, Sijie, et al.
Pubblicazione: (2026)
di: Li, Sijie, et al.
Pubblicazione: (2026)
Provably tuning the ElasticNet across instances
di: Balcan, Maria-Florina, et al.
Pubblicazione: (2022)
di: Balcan, Maria-Florina, et al.
Pubblicazione: (2022)
Learning to Relax: Setting Solver Parameters Across a Sequence of Linear System Instances
di: Khodak, Mikhail, et al.
Pubblicazione: (2023)
di: Khodak, Mikhail, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Scaling Test-Time Compute Without Verification or RL is Suboptimal
di: Setlur, Amrith, et al.
Pubblicazione: (2025) -
Reasoning Cache: Continual Improvement Over Long Horizons via Short-Horizon RL
di: Wu, Ian, et al.
Pubblicazione: (2026) -
Multitask Learning Can Improve Worst-Group Outcomes
di: Kulkarni, Atharva, et al.
Pubblicazione: (2023) -
UPS: Efficiently Building Foundation Models for PDE Solving via Cross-Modal Adaptation
di: Shen, Junhong, et al.
Pubblicazione: (2024) -
RL on Incorrect Synthetic Data Scales the Efficiency of LLM Math Reasoning by Eight-Fold
di: Setlur, Amrith, et al.
Pubblicazione: (2024)