Endless Terminals: Scaling RL Environments for Terminal Agents
Fuente:
arXiv
Salvato in:
| Autori principali: | Gandhi, Kanishk, Garg, Shivam, Goodman, Noah D., Papailiopoulos, Dimitris |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Cognitive Behaviors that Enable Self-Improving Reasoners, or, Four Habits of Highly Effective STaRs
di: Gandhi, Kanishk, et al.
Pubblicazione: (2025)
di: Gandhi, Kanishk, et al.
Pubblicazione: (2025)
Sample More to Think Less: Group Filtered Policy Optimization for Concise Reasoning
di: Shrivastava, Vaishnavi, et al.
Pubblicazione: (2025)
di: Shrivastava, Vaishnavi, et al.
Pubblicazione: (2025)
Stream of Search (SoS): Learning to Search in Language
di: Gandhi, Kanishk, et al.
Pubblicazione: (2024)
di: Gandhi, Kanishk, et al.
Pubblicazione: (2024)
Learning to Simulate Human Dialogue
di: Gandhi, Kanishk, et al.
Pubblicazione: (2026)
di: Gandhi, Kanishk, et al.
Pubblicazione: (2026)
Predictive Pipelined Decoding: A Compute-Latency Trade-off for Exact LLM Decoding
di: Yang, Seongjun, et al.
Pubblicazione: (2023)
di: Yang, Seongjun, et al.
Pubblicazione: (2023)
From Artificial Needles to Real Haystacks: Improving Retrieval Capabilities in LLMs by Finetuning on Synthetic Data
di: Xiong, Zheyang, et al.
Pubblicazione: (2024)
di: Xiong, Zheyang, et al.
Pubblicazione: (2024)
Terminal-World: Scaling Terminal-Agent Environments via Agent Skills
di: Cheng, Zihao, et al.
Pubblicazione: (2026)
di: Cheng, Zihao, et al.
Pubblicazione: (2026)
RL on Incorrect Synthetic Data Scales the Efficiency of LLM Math Reasoning by Eight-Fold
di: Setlur, Amrith, et al.
Pubblicazione: (2024)
di: Setlur, Amrith, et al.
Pubblicazione: (2024)
EnvFactory: Scaling Tool-Use Agents via Executable Environments Synthesis and Robust RL
di: Xu, Minrui, et al.
Pubblicazione: (2026)
di: Xu, Minrui, et al.
Pubblicazione: (2026)
WEBSERV: A Full-Stack and RL-Ready Web Environment for Training Web Agents at Scale
di: Lu, Yuxuan, et al.
Pubblicazione: (2025)
di: Lu, Yuxuan, et al.
Pubblicazione: (2025)
Bifocal Attention: Harmonizing Geometric and Spectral Positional Embeddings for Algorithmic Generalization
di: Awadhiya, Kanishk
Pubblicazione: (2026)
di: Awadhiya, Kanishk
Pubblicazione: (2026)
LiteCoder-Terminal: Scaling Long-Horizon Terminal Environments for Learning Language Agents
di: Peng, Xiaoxuan, et al.
Pubblicazione: (2026)
di: Peng, Xiaoxuan, et al.
Pubblicazione: (2026)
State Representation and Termination for Recursive Reasoning Systems
di: Guha, Debashis, et al.
Pubblicazione: (2026)
di: Guha, Debashis, et al.
Pubblicazione: (2026)
Automated Statistical Model Discovery with Language Models
di: Li, Michael Y., et al.
Pubblicazione: (2024)
di: Li, Michael Y., et al.
Pubblicazione: (2024)
Scaling up the think-aloud method
di: Wurgaft, Daniel, et al.
Pubblicazione: (2025)
di: Wurgaft, Daniel, et al.
Pubblicazione: (2025)
Transformers for Program Termination
di: Alon, Yoav, et al.
Pubblicazione: (2026)
di: Alon, Yoav, et al.
Pubblicazione: (2026)
CHAI: Clustered Head Attention for Efficient LLM Inference
di: Agarwal, Saurabh, et al.
Pubblicazione: (2024)
di: Agarwal, Saurabh, et al.
Pubblicazione: (2024)
Wait, Wait, Wait... Why Do Reasoning Models Loop?
di: Pipis, Charilaos, et al.
Pubblicazione: (2025)
di: Pipis, Charilaos, et al.
Pubblicazione: (2025)
Large Language Model Reasoning Failures
di: Song, Peiyang, et al.
Pubblicazione: (2026)
di: Song, Peiyang, et al.
Pubblicazione: (2026)
MobileGUI-RL: Advancing Mobile GUI Agent through Reinforcement Learning in Online Environment
di: Shi, Yucheng, et al.
Pubblicazione: (2025)
di: Shi, Yucheng, et al.
Pubblicazione: (2025)
Memex(RL): Scaling Long-Horizon LLM Agents via Indexed Experience Memory
di: Wang, Zhenting, et al.
Pubblicazione: (2026)
di: Wang, Zhenting, et al.
Pubblicazione: (2026)
Non-literal Understanding of Number Words by Language Models
di: Tsvilodub, Polina, et al.
Pubblicazione: (2025)
di: Tsvilodub, Polina, et al.
Pubblicazione: (2025)
Self-Supervised Alignment with Mutual Information: Learning to Follow Principles without Preference Labels
di: Fränken, Jan-Philipp, et al.
Pubblicazione: (2024)
di: Fränken, Jan-Philipp, et al.
Pubblicazione: (2024)
Procedural Dilemma Generation for Evaluating Moral Reasoning in Humans and Language Models
di: Fränken, Jan-Philipp, et al.
Pubblicazione: (2024)
di: Fränken, Jan-Philipp, et al.
Pubblicazione: (2024)
TACO-RL: Task Aware Prompt Compression Optimization with Reinforcement Learning
di: Shandilya, Shivam, et al.
Pubblicazione: (2024)
di: Shandilya, Shivam, et al.
Pubblicazione: (2024)
Is Child-Directed Speech Effective Training Data for Language Models?
di: Feng, Steven Y., et al.
Pubblicazione: (2024)
di: Feng, Steven Y., et al.
Pubblicazione: (2024)
Big-Math: A Large-Scale, High-Quality Math Dataset for Reinforcement Learning in Language Models
di: Albalak, Alon, et al.
Pubblicazione: (2025)
di: Albalak, Alon, et al.
Pubblicazione: (2025)
CriticAL: Critic Automation with Language Models
di: Li, Michael Y., et al.
Pubblicazione: (2024)
di: Li, Michael Y., et al.
Pubblicazione: (2024)
Scaling Test-Time Compute Without Verification or RL is Suboptimal
di: Setlur, Amrith, et al.
Pubblicazione: (2025)
di: Setlur, Amrith, et al.
Pubblicazione: (2025)
BroRL: Scaling Reinforcement Learning via Broadened Exploration
di: Hu, Jian, et al.
Pubblicazione: (2025)
di: Hu, Jian, et al.
Pubblicazione: (2025)
PhoneWorld: Scaling Phone-Use Agent Environments
di: Tang, Zhengyang, et al.
Pubblicazione: (2026)
di: Tang, Zhengyang, et al.
Pubblicazione: (2026)
Selective Rollout: Mid-Trajectory Termination for Multi-Sample Agent RL
di: Zhai, Zhiyuan, et al.
Pubblicazione: (2026)
di: Zhai, Zhiyuan, et al.
Pubblicazione: (2026)
pyvene: A Library for Understanding and Improving PyTorch Models via Interventions
di: Wu, Zhengxuan, et al.
Pubblicazione: (2024)
di: Wu, Zhengxuan, et al.
Pubblicazione: (2024)
Search, Examine and Early-Termination: Fake News Detection with Annotation-Free Evidences
di: Yang, Yuzhou, et al.
Pubblicazione: (2024)
di: Yang, Yuzhou, et al.
Pubblicazione: (2024)
ELSA: A Style Aligned Dataset for Emotionally Intelligent Language Generation
di: Gandhi, Vishal, et al.
Pubblicazione: (2025)
di: Gandhi, Vishal, et al.
Pubblicazione: (2025)
SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution
di: Wang, Hanlin, et al.
Pubblicazione: (2025)
di: Wang, Hanlin, et al.
Pubblicazione: (2025)
LIMR: Less is More for RL Scaling
di: Li, Xuefeng, et al.
Pubblicazione: (2025)
di: Li, Xuefeng, et al.
Pubblicazione: (2025)
Hypothesis Search: Inductive Reasoning with Language Models
di: Wang, Ruocheng, et al.
Pubblicazione: (2023)
di: Wang, Ruocheng, et al.
Pubblicazione: (2023)
Quiet-STaR: Language Models Can Teach Themselves to Think Before Speaking
di: Zelikman, Eric, et al.
Pubblicazione: (2024)
di: Zelikman, Eric, et al.
Pubblicazione: (2024)
Patch the Distribution Mismatch: RL Rewriting Agent for Stable Off-Policy SFT
di: Wang, Jiacheng, et al.
Pubblicazione: (2026)
di: Wang, Jiacheng, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Cognitive Behaviors that Enable Self-Improving Reasoners, or, Four Habits of Highly Effective STaRs
di: Gandhi, Kanishk, et al.
Pubblicazione: (2025) -
Sample More to Think Less: Group Filtered Policy Optimization for Concise Reasoning
di: Shrivastava, Vaishnavi, et al.
Pubblicazione: (2025) -
Stream of Search (SoS): Learning to Search in Language
di: Gandhi, Kanishk, et al.
Pubblicazione: (2024) -
Learning to Simulate Human Dialogue
di: Gandhi, Kanishk, et al.
Pubblicazione: (2026) -
Predictive Pipelined Decoding: A Compute-Latency Trade-off for Exact LLM Decoding
di: Yang, Seongjun, et al.
Pubblicazione: (2023)