InSTA: Towards Internet-Scale Training For Agents
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Trabucco, Brandon, Sigurdsson, Gunnar, Piramuthu, Robinson, Salakhutdinov, Ruslan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Understanding Visual Concepts Across Models
par: Trabucco, Brandon, et autres
Publié: (2024)
par: Trabucco, Brandon, et autres
Publié: (2024)
Effective Data Augmentation With Diffusion Models
par: Trabucco, Brandon, et autres
Publié: (2023)
par: Trabucco, Brandon, et autres
Publié: (2023)
Contrastive Difference Predictive Coding
par: Zheng, Chongyi, et autres
Publié: (2023)
par: Zheng, Chongyi, et autres
Publié: (2023)
Training a Generally Curious Agent
par: Tajwar, Fahim, et autres
Publié: (2025)
par: Tajwar, Fahim, et autres
Publié: (2025)
Tree Search for Language Model Agents
par: Koh, Jing Yu, et autres
Publié: (2024)
par: Koh, Jing Yu, et autres
Publié: (2024)
Stylus: Automatic Adapter Selection for Diffusion Models
par: Luo, Michael, et autres
Publié: (2024)
par: Luo, Michael, et autres
Publié: (2024)
RLAD: Training LLMs to Discover Abstractions for Solving Reasoning Problems
par: Qu, Yuxiao, et autres
Publié: (2025)
par: Qu, Yuxiao, et autres
Publié: (2025)
AgentKit: Structured LLM Reasoning with Dynamic Graphs
par: Wu, Yue, et autres
Publié: (2024)
par: Wu, Yue, et autres
Publié: (2024)
POPE: Learning to Reason on Hard Problems via Privileged On-Policy Exploration
par: Qu, Yuxiao, et autres
Publié: (2026)
par: Qu, Yuxiao, et autres
Publié: (2026)
Accelerating Diffusion Planners in Offline RL via Reward-Aware Consistency Trajectory Distillation
par: Duan, Xintong, et autres
Publié: (2025)
par: Duan, Xintong, et autres
Publié: (2025)
Stabilizing Contrastive RL: Techniques for Robotic Goal Reaching from Offline Data
par: Zheng, Chongyi, et autres
Publié: (2023)
par: Zheng, Chongyi, et autres
Publié: (2023)
Plan-Seq-Learn: Language Model Guided RL for Solving Long Horizon Robotics Tasks
par: Dalal, Murtaza, et autres
Publié: (2024)
par: Dalal, Murtaza, et autres
Publié: (2024)
FACTR: Force-Attending Curriculum Training for Contact-Rich Policy Learning
par: Liu, Jason Jingzhou, et autres
Publié: (2025)
par: Liu, Jason Jingzhou, et autres
Publié: (2025)
Rethinking Thinking Tokens: LLMs as Improvement Operators
par: Madaan, Lovish, et autres
Publié: (2025)
par: Madaan, Lovish, et autres
Publié: (2025)
STA-GANN: A Valid and Generalizable Spatio-Temporal Kriging Approach
par: Li, Yujie, et autres
Publié: (2025)
par: Li, Yujie, et autres
Publié: (2025)
IsoCompute Playbook: Optimally Scaling Sampling Compute for LLM RL
par: Cheng, Zhoujun, et autres
Publié: (2026)
par: Cheng, Zhoujun, et autres
Publié: (2026)
AFD-STA: Adaptive Filtering Denoising with Spatiotemporal Attention for Chaotic System Prediction
par: Gong, Chunlin, et autres
Publié: (2025)
par: Gong, Chunlin, et autres
Publié: (2025)
UrbanAI 2025 Challenge: Linear vs Transformer Models for Long-Horizon Exogenous Temperature Forecasting
par: Gokhman, Ruslan
Publié: (2025)
par: Gokhman, Ruslan
Publié: (2025)
Blind Inverse Problem Solving Made Easy by Text-to-Image Latent Diffusion
par: Dontas, Michail, et autres
Publié: (2024)
par: Dontas, Michail, et autres
Publié: (2024)
Introspective X Training: Feedback Conditioning Improves Scaling Across all LLM Training Stages
par: Cui, Brandon, et autres
Publié: (2026)
par: Cui, Brandon, et autres
Publié: (2026)
Neural MP: A Generalist Neural Motion Planner
par: Dalal, Murtaza, et autres
Publié: (2024)
par: Dalal, Murtaza, et autres
Publié: (2024)
Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning
par: Qu, Yuxiao, et autres
Publié: (2025)
par: Qu, Yuxiao, et autres
Publié: (2025)
Towards Next-Level Post-Training Quantization of Hyper-Scale Transformers
par: Kim, Junhan, et autres
Publié: (2024)
par: Kim, Junhan, et autres
Publié: (2024)
VaPR -- Vision-language Preference alignment for Reasoning
par: Wadhawan, Rohan, et autres
Publié: (2025)
par: Wadhawan, Rohan, et autres
Publié: (2025)
Enhancing Vision-Language Model Training with Reinforcement Learning in Synthetic Worlds for Real-World Success
par: Bredis, George, et autres
Publié: (2025)
par: Bredis, George, et autres
Publié: (2025)
CUA-Gym: Scaling Verifiable Training Environments and Tasks for Computer-Use Agents
par: Wang, Bowen, et autres
Publié: (2026)
par: Wang, Bowen, et autres
Publié: (2026)
DeepSTA: A Spatial-Temporal Attention Network for Logistics Delivery Timely Rate Prediction in Anomaly Conditions
par: Yi, Jinhui, et autres
Publié: (2025)
par: Yi, Jinhui, et autres
Publié: (2025)
Towards Large-Scale In-Context Reinforcement Learning by Meta-Training in Randomized Worlds
par: Wang, Fan, et autres
Publié: (2025)
par: Wang, Fan, et autres
Publié: (2025)
MultiIoT: Benchmarking Machine Learning for the Internet of Things
par: Mo, Shentong, et autres
Publié: (2023)
par: Mo, Shentong, et autres
Publié: (2023)
Embodied-RAG: General Non-parametric Embodied Memory for Retrieval and Generation
par: Xie, Quanting, et autres
Publié: (2024)
par: Xie, Quanting, et autres
Publié: (2024)
IoT-LM: Large Multisensory Language Models for the Internet of Things
par: Mo, Shentong, et autres
Publié: (2024)
par: Mo, Shentong, et autres
Publié: (2024)
Leafy Spurge Dataset: Real-world Weed Classification Within Aerial Drone Imagery
par: Doherty, Kyle, et autres
Publié: (2024)
par: Doherty, Kyle, et autres
Publié: (2024)
Evaluation of human-model prediction difference on the Internet Scale of Data
par: Liu, Weitang, et autres
Publié: (2023)
par: Liu, Weitang, et autres
Publié: (2023)
Towards Dynamic Feature Acquisition on Medical Time Series by Maximizing Conditional Mutual Information
par: Sergeev, Fedor, et autres
Publié: (2024)
par: Sergeev, Fedor, et autres
Publié: (2024)
TrafficGPT: Towards Multi-Scale Traffic Analysis and Generation with Spatial-Temporal Agent Framework
par: Ouyang, Jinhui, et autres
Publié: (2024)
par: Ouyang, Jinhui, et autres
Publié: (2024)
Agent Lightning: Train ANY AI Agents with Reinforcement Learning
par: Luo, Xufang, et autres
Publié: (2025)
par: Luo, Xufang, et autres
Publié: (2025)
Training LLM Agents to Empower Humans
par: Ellis, Evan, et autres
Publié: (2025)
par: Ellis, Evan, et autres
Publié: (2025)
Training Agents to Self-Report Misbehavior
par: Lee, Bruce W., et autres
Publié: (2026)
par: Lee, Bruce W., et autres
Publié: (2026)
Scaling Test-Time Compute for Agentic Coding
par: Kim, Joongwon, et autres
Publié: (2026)
par: Kim, Joongwon, et autres
Publié: (2026)
Wukong: Towards a Scaling Law for Large-Scale Recommendation
par: Zhang, Buyun, et autres
Publié: (2024)
par: Zhang, Buyun, et autres
Publié: (2024)
Documents similaires
-
Understanding Visual Concepts Across Models
par: Trabucco, Brandon, et autres
Publié: (2024) -
Effective Data Augmentation With Diffusion Models
par: Trabucco, Brandon, et autres
Publié: (2023) -
Contrastive Difference Predictive Coding
par: Zheng, Chongyi, et autres
Publié: (2023) -
Training a Generally Curious Agent
par: Tajwar, Fahim, et autres
Publié: (2025) -
Tree Search for Language Model Agents
par: Koh, Jing Yu, et autres
Publié: (2024)