Extending Test-Time Scaling: A 3D Perspective with Context, Batch, and Turn
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yu, Chao, Tan, Qixin, Gao, Jiaxuan, Yu, Shi, Lu, Hong, Yang, Xinting, Xu, Zelai, Wang, Yu, Wu, Yi, Vinitsky, Eugene |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ICPL: Few-shot In-context Preference Learning via LLMs
par: Yu, Chao, et autres
Publié: (2024)
par: Yu, Chao, et autres
Publié: (2024)
AED: Automatic Discovery of Effective and Diverse Vulnerabilities for Autonomous Driving Policy with Large Language Models
par: Qiu, Le, et autres
Publié: (2025)
par: Qiu, Le, et autres
Publié: (2025)
MAGE: Meta-Reinforcement Learning for Language Agents toward Strategic Exploration and Exploitation
par: Yang, Lu, et autres
Publié: (2026)
par: Yang, Lu, et autres
Publié: (2026)
Language Agents with Reinforcement Learning for Strategic Play in the Werewolf Game
par: Xu, Zelai, et autres
Publié: (2023)
par: Xu, Zelai, et autres
Publié: (2023)
Learning Strategic Language Agents in the Werewolf Game with Iterative Latent Space Policy Optimization
par: Xu, Zelai, et autres
Publié: (2025)
par: Xu, Zelai, et autres
Publié: (2025)
Verifiable Process Rewards for Agentic Reasoning
par: Yuan, Huining, et autres
Publié: (2026)
par: Yuan, Huining, et autres
Publié: (2026)
Human-compatible driving partners through data-regularized self-play reinforcement learning
par: Cornelisse, Daphne, et autres
Publié: (2024)
par: Cornelisse, Daphne, et autres
Publié: (2024)
Superhuman AI for Stratego Using Self-Play Reinforcement Learning and Test-Time Search
par: Sokota, Samuel, et autres
Publié: (2025)
par: Sokota, Samuel, et autres
Publié: (2025)
WideSeek-R1: Exploring Width Scaling for Broad Information Seeking via Multi-Agent Reinforcement Learning
par: Xu, Zelai, et autres
Publié: (2026)
par: Xu, Zelai, et autres
Publié: (2026)
Fine-tuning Diffusion Policies with Backpropagation Through Diffusion Timesteps
par: Yang, Ningyuan, et autres
Publié: (2025)
par: Yang, Ningyuan, et autres
Publié: (2025)
Test-Time Policy Adaptation for Enhanced Multi-Turn Interactions with LLMs
par: Wei, Chenxing, et autres
Publié: (2025)
par: Wei, Chenxing, et autres
Publié: (2025)
EARL: Efficient Agentic Reinforcement Learning Systems for Large Language Models
par: Tan, Zheyue, et autres
Publié: (2025)
par: Tan, Zheyue, et autres
Publié: (2025)
Beyond Ten Turns: Unlocking Long-Horizon Agentic Search with Large-Scale Asynchronous RL
par: Gao, Jiaxuan, et autres
Publié: (2025)
par: Gao, Jiaxuan, et autres
Publié: (2025)
VS-Bench: Evaluating VLMs for Strategic Abilities in Multi-Agent Environments
par: Xu, Zelai, et autres
Publié: (2025)
par: Xu, Zelai, et autres
Publié: (2025)
LAGOON: Language-Guided Motion Control
par: Xu, Shusheng, et autres
Publié: (2023)
par: Xu, Shusheng, et autres
Publié: (2023)
How Far Are We from Optimal Reasoning Efficiency?
par: Gao, Jiaxuan, et autres
Publié: (2025)
par: Gao, Jiaxuan, et autres
Publié: (2025)
On the Learnability of Test-Time Adaptation: A Recovery Complexity Perspective
par: Zhou, Zhi, et autres
Publié: (2026)
par: Zhou, Zhi, et autres
Publié: (2026)
The Fate of Simple Organics on Titan's Surface: A Theoretical Perspective
par: Yu, Xinting, et autres
Publié: (2024)
par: Yu, Xinting, et autres
Publié: (2024)
Video Game Level Design as a Multi-Agent Reinforcement Learning Problem
par: Earle, Sam, et autres
Publié: (2025)
par: Earle, Sam, et autres
Publié: (2025)
UniScale: Adaptive Unified Inference Scaling via Online Joint Optimization of Model Routing and Test-Time Scaling
par: Huang, Kaiyu, et autres
Publié: (2026)
par: Huang, Kaiyu, et autres
Publié: (2026)
Large Language Models: A Historical and Sociocultural Perspective
par: Eugene Yu Ji
Publié: (2024)
par: Eugene Yu Ji
Publié: (2024)
RE-PO: Robust Enhanced Policy Optimization as a General Framework for LLM Alignment
par: Cao, Xiaoyang, et autres
Publié: (2025)
par: Cao, Xiaoyang, et autres
Publié: (2025)
LLM-Powered Hierarchical Language Agent for Real-time Human-AI Coordination
par: Liu, Jijia, et autres
Publié: (2023)
par: Liu, Jijia, et autres
Publié: (2023)
Extended Poincare Symmetry Dictates Massive Scattering Amplitudes
par: Ni, Yu-Han, et autres
Publié: (2024)
par: Ni, Yu-Han, et autres
Publié: (2024)
CoE-SQL: In-Context Learning for Multi-Turn Text-to-SQL with Chain-of-Editions
par: Zhang, Hanchong, et autres
Publié: (2024)
par: Zhang, Hanchong, et autres
Publié: (2024)
Mastering Multi-Drone Volleyball through Hierarchical Co-Self-Play Reinforcement Learning
par: Zhang, Ruize, et autres
Publié: (2025)
par: Zhang, Ruize, et autres
Publié: (2025)
D3P: Dynamic Denoising Diffusion Policy via Reinforcement Learning
par: Yu, Shu-Ang, et autres
Publié: (2025)
par: Yu, Shu-Ang, et autres
Publié: (2025)
Atom of Thoughts for Markov LLM Test-Time Scaling
par: Teng, Fengwei, et autres
Publié: (2025)
par: Teng, Fengwei, et autres
Publié: (2025)
Decoding Ambiguous Emotions with Test-Time Scaling in Audio-Language Models
par: Jia, Hong, et autres
Publié: (2026)
par: Jia, Hong, et autres
Publié: (2026)
Fuzzy Logic Guided Reward Function Variation: An Oracle for Testing Reinforcement Learning Programs
par: Zhang, Shiyu, et autres
Publié: (2024)
par: Zhang, Shiyu, et autres
Publié: (2024)
Scale Snapshot Topology Distance: Quantifying the Spatial Scale Effect From a Topological Perspective
par: Jiawei Zhu, et autres
Publié: (2025)
par: Jiawei Zhu, et autres
Publié: (2025)
ContextPRM: Leveraging Contextual Coherence for multi-domain Test-Time Scaling
par: Zhang, Haotian, et autres
Publié: (2025)
par: Zhang, Haotian, et autres
Publié: (2025)
JAL-Turn: Joint Acoustic-Linguistic Modeling for Real-Time and Robust Turn-Taking Detection in Full-Duplex Spoken Dialogue Systems
par: Yang, Guangzhao, et autres
Publié: (2026)
par: Yang, Guangzhao, et autres
Publié: (2026)
RAPO++: Cross-Stage Prompt Optimization for Text-to-Video Generation via Data Alignment and Test-Time Scaling
par: Gao, Bingjie, et autres
Publié: (2025)
par: Gao, Bingjie, et autres
Publié: (2025)
In-Context Edit: Enabling Instructional Image Editing with In-Context Generation in Large Scale Diffusion Transformer
par: Zhang, Zechuan, et autres
Publié: (2025)
par: Zhang, Zechuan, et autres
Publié: (2025)
Online distributed algorithms for mixed equilibrium problems in dynamic environments
par: Xu, Hang, et autres
Publié: (2024)
par: Xu, Hang, et autres
Publié: (2024)
Neural Internal Model Control: Learning a Robust Control Policy via Predictive Error Feedback
par: Gao, Feng, et autres
Publié: (2024)
par: Gao, Feng, et autres
Publié: (2024)
GPUDrive: Data-driven, multi-agent driving simulation at 1 million FPS
par: Kazemkhani, Saman, et autres
Publié: (2024)
par: Kazemkhani, Saman, et autres
Publié: (2024)
Building reliable sim driving agents by scaling self-play
par: Cornelisse, Daphne, et autres
Publié: (2025)
par: Cornelisse, Daphne, et autres
Publié: (2025)
VolleyBots: A Testbed for Multi-Drone Volleyball Game Combining Motion Control and Strategic Play
par: Xu, Zelai, et autres
Publié: (2025)
par: Xu, Zelai, et autres
Publié: (2025)
Documents similaires
-
ICPL: Few-shot In-context Preference Learning via LLMs
par: Yu, Chao, et autres
Publié: (2024) -
AED: Automatic Discovery of Effective and Diverse Vulnerabilities for Autonomous Driving Policy with Large Language Models
par: Qiu, Le, et autres
Publié: (2025) -
MAGE: Meta-Reinforcement Learning for Language Agents toward Strategic Exploration and Exploitation
par: Yang, Lu, et autres
Publié: (2026) -
Language Agents with Reinforcement Learning for Strategic Play in the Werewolf Game
par: Xu, Zelai, et autres
Publié: (2023) -
Learning Strategic Language Agents in the Werewolf Game with Iterative Latent Space Policy Optimization
par: Xu, Zelai, et autres
Publié: (2025)