Training a Generally Curious Agent
Fuente:
arXiv
Salvato in:
| Autori principali: | Tajwar, Fahim, Jiang, Yiding, Thankaraj, Abitha, Rahman, Sumaita Sadia, Kolter, J Zico, Schneider, Jeff, Salakhutdinov, Ruslan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Looking beyond the next token
di: Thankaraj, Abitha, et al.
Pubblicazione: (2025)
di: Thankaraj, Abitha, et al.
Pubblicazione: (2025)
Accelerating Diffusion Planners in Offline RL via Reward-Aware Consistency Trajectory Distillation
di: Duan, Xintong, et al.
Pubblicazione: (2025)
di: Duan, Xintong, et al.
Pubblicazione: (2025)
Can Large Reasoning Models Self-Train?
di: Shafayat, Sheikh, et al.
Pubblicazione: (2025)
di: Shafayat, Sheikh, et al.
Pubblicazione: (2025)
Automated Black-box Prompt Engineering for Personalized Text-to-Image Generation
di: He, Yutong, et al.
Pubblicazione: (2024)
di: He, Yutong, et al.
Pubblicazione: (2024)
Blind Inverse Problem Solving Made Easy by Text-to-Image Latent Diffusion
di: Dontas, Michail, et al.
Pubblicazione: (2024)
di: Dontas, Michail, et al.
Pubblicazione: (2024)
Tree Search for Language Model Agents
di: Koh, Jing Yu, et al.
Pubblicazione: (2024)
di: Koh, Jing Yu, et al.
Pubblicazione: (2024)
A Simple and Effective Pruning Approach for Large Language Models
di: Sun, Mingjie, et al.
Pubblicazione: (2023)
di: Sun, Mingjie, et al.
Pubblicazione: (2023)
State Combinatorial Generalization In Decision Making With Conditional Diffusion Models
di: Duan, Xintong, et al.
Pubblicazione: (2025)
di: Duan, Xintong, et al.
Pubblicazione: (2025)
Not All Rollouts are Useful: Down-Sampling Rollouts in LLM Reinforcement Learning
di: Xu, Yixuan Even, et al.
Pubblicazione: (2025)
di: Xu, Yixuan Even, et al.
Pubblicazione: (2025)
InSTA: Towards Internet-Scale Training For Agents
di: Trabucco, Brandon, et al.
Pubblicazione: (2025)
di: Trabucco, Brandon, et al.
Pubblicazione: (2025)
RLAD: Training LLMs to Discover Abstractions for Solving Reasoning Problems
di: Qu, Yuxiao, et al.
Pubblicazione: (2025)
di: Qu, Yuxiao, et al.
Pubblicazione: (2025)
Base Models Look Human To AI Detectors
di: Xu, Yixuan Even, et al.
Pubblicazione: (2026)
di: Xu, Yixuan Even, et al.
Pubblicazione: (2026)
POPE: Learning to Reason on Hard Problems via Privileged On-Policy Exploration
di: Qu, Yuxiao, et al.
Pubblicazione: (2026)
di: Qu, Yuxiao, et al.
Pubblicazione: (2026)
Self-Regulation and Requesting Interventions
di: Min, So Yeon, et al.
Pubblicazione: (2025)
di: Min, So Yeon, et al.
Pubblicazione: (2025)
Maximum Likelihood Reinforcement Learning
di: Tajwar, Fahim, et al.
Pubblicazione: (2026)
di: Tajwar, Fahim, et al.
Pubblicazione: (2026)
Mimetic Initialization of MLPs
di: Trockman, Asher, et al.
Pubblicazione: (2026)
di: Trockman, Asher, et al.
Pubblicazione: (2026)
Retrospective In-Context Learning for Temporal Credit Assignment with Large Language Models
di: Chen, Wen-Tse, et al.
Pubblicazione: (2026)
di: Chen, Wen-Tse, et al.
Pubblicazione: (2026)
AgentHarm: A Benchmark for Measuring Harmfulness of LLM Agents
di: Andriushchenko, Maksym, et al.
Pubblicazione: (2024)
di: Andriushchenko, Maksym, et al.
Pubblicazione: (2024)
Reasoning as an Adaptive Defense for Safety
di: Kim, Taeyoun, et al.
Pubblicazione: (2025)
di: Kim, Taeyoun, et al.
Pubblicazione: (2025)
Existing Large Language Model Unlearning Evaluations Are Inconclusive
di: Feng, Zhili, et al.
Pubblicazione: (2025)
di: Feng, Zhili, et al.
Pubblicazione: (2025)
Antidistillation Fingerprinting
di: Xu, Yixuan Even, et al.
Pubblicazione: (2026)
di: Xu, Yixuan Even, et al.
Pubblicazione: (2026)
Contrastive Difference Predictive Coding
di: Zheng, Chongyi, et al.
Pubblicazione: (2023)
di: Zheng, Chongyi, et al.
Pubblicazione: (2023)
ROGUE: Misaligned Agent Behavior Arising from Ordinary Computer Use
di: Tien, Jeremy, et al.
Pubblicazione: (2026)
di: Tien, Jeremy, et al.
Pubblicazione: (2026)
Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning
di: Qu, Yuxiao, et al.
Pubblicazione: (2025)
di: Qu, Yuxiao, et al.
Pubblicazione: (2025)
CaRT: Teaching LLM Agents to Know When They Know Enough
di: Liu, Grace, et al.
Pubblicazione: (2025)
di: Liu, Grace, et al.
Pubblicazione: (2025)
Test-Time Adaptation Induces Stronger Accuracy and Agreement-on-the-Line
di: Kim, Eungyeup, et al.
Pubblicazione: (2023)
di: Kim, Eungyeup, et al.
Pubblicazione: (2023)
Superhuman AI for Stratego Using Self-Play Reinforcement Learning and Test-Time Search
di: Sokota, Samuel, et al.
Pubblicazione: (2025)
di: Sokota, Samuel, et al.
Pubblicazione: (2025)
Neural Network Verification with Branch-and-Bound for General Nonlinearities
di: Shi, Zhouxing, et al.
Pubblicazione: (2024)
di: Shi, Zhouxing, et al.
Pubblicazione: (2024)
Weight Ensembling Improves Reasoning in Language Models
di: Dang, Xingyu, et al.
Pubblicazione: (2025)
di: Dang, Xingyu, et al.
Pubblicazione: (2025)
FUSE-ing Language Models: Zero-Shot Adapter Discovery for Prompt Optimization Across Tokenizers
di: Williams, Joshua Nathaniel, et al.
Pubblicazione: (2024)
di: Williams, Joshua Nathaniel, et al.
Pubblicazione: (2024)
Conservative Prediction via Data-Driven Confidence Minimization
di: Choi, Caroline, et al.
Pubblicazione: (2023)
di: Choi, Caroline, et al.
Pubblicazione: (2023)
Predicting the Performance of Black-box LLMs through Follow-up Queries
di: Sam, Dylan, et al.
Pubblicazione: (2025)
di: Sam, Dylan, et al.
Pubblicazione: (2025)
Transformers to SSMs: Distilling Quadratic Knowledge to Subquadratic Models
di: Bick, Aviv, et al.
Pubblicazione: (2024)
di: Bick, Aviv, et al.
Pubblicazione: (2024)
Compute-Optimal LLMs Provably Generalize Better With Scale
di: Finzi, Marc, et al.
Pubblicazione: (2025)
di: Finzi, Marc, et al.
Pubblicazione: (2025)
Knowledge is Not Enough: Injecting RL Skills for Continual Adaptation
di: Tang, Pingzhi, et al.
Pubblicazione: (2026)
di: Tang, Pingzhi, et al.
Pubblicazione: (2026)
Provably Bounding Neural Network Preimages
di: Kotha, Suhas, et al.
Pubblicazione: (2023)
di: Kotha, Suhas, et al.
Pubblicazione: (2023)
Multi-Agent Computer Use
di: Koh, Jing Yu, et al.
Pubblicazione: (2026)
di: Koh, Jing Yu, et al.
Pubblicazione: (2026)
LLMs as Scalable, General-Purpose Simulators For Evolving Digital Agent Training
di: Wang, Yiming, et al.
Pubblicazione: (2025)
di: Wang, Yiming, et al.
Pubblicazione: (2025)
Contextures: Representations from Contexts
di: Zhai, Runtian, et al.
Pubblicazione: (2025)
di: Zhai, Runtian, et al.
Pubblicazione: (2025)
EnvGen: Generating and Adapting Environments via LLMs for Training Embodied Agents
di: Zala, Abhay, et al.
Pubblicazione: (2024)
di: Zala, Abhay, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Looking beyond the next token
di: Thankaraj, Abitha, et al.
Pubblicazione: (2025) -
Accelerating Diffusion Planners in Offline RL via Reward-Aware Consistency Trajectory Distillation
di: Duan, Xintong, et al.
Pubblicazione: (2025) -
Can Large Reasoning Models Self-Train?
di: Shafayat, Sheikh, et al.
Pubblicazione: (2025) -
Automated Black-box Prompt Engineering for Personalized Text-to-Image Generation
di: He, Yutong, et al.
Pubblicazione: (2024) -
Blind Inverse Problem Solving Made Easy by Text-to-Image Latent Diffusion
di: Dontas, Michail, et al.
Pubblicazione: (2024)