Proposer-Agent-Evaluator(PAE): Autonomous Skill Discovery For Foundation Model Internet Agents
Fuente:
arXiv
Saved in:
| Main Authors: | Zhou, Yifei, Yang, Qianlan, Lin, Kaixiang, Bai, Min, Zhou, Xiong, Wang, Yu-Xiong, Levine, Sergey, Li, Erran |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
ATraDiff: Accelerating Online Reinforcement Learning with Imaginary Trajectories
by: Yang, Qianlan, et al.
Published: (2024)
by: Yang, Qianlan, et al.
Published: (2024)
AffordanceLLM: Grounding Affordance from Vision Language Models
by: Qian, Shengyi, et al.
Published: (2024)
by: Qian, Shengyi, et al.
Published: (2024)
ViGoR: Improving Visual Grounding of Large Vision Language Models with Fine-Grained Reward Modeling
by: Yan, Siming, et al.
Published: (2024)
by: Yan, Siming, et al.
Published: (2024)
Digi-Q: Learning Q-Value Functions for Training Device-Control Agents
by: Bai, Hao, et al.
Published: (2025)
by: Bai, Hao, et al.
Published: (2025)
Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning
by: Zhai, Yuexiang, et al.
Published: (2024)
by: Zhai, Yuexiang, et al.
Published: (2024)
MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models
by: Chen, Kaixiang, et al.
Published: (2026)
by: Chen, Kaixiang, et al.
Published: (2026)
When Rules Fall Short: Agent-Driven Discovery of Emerging Content Issues in Short Video Platforms
by: Yu, Chenghui, et al.
Published: (2026)
by: Yu, Chenghui, et al.
Published: (2026)
Aurora: Unified Video Editing with a Tool-Using Agent
by: Yu, Yongsheng, et al.
Published: (2026)
by: Yu, Yongsheng, et al.
Published: (2026)
TransAgent: Transfer Vision-Language Foundation Models with Heterogeneous Agent Collaboration
by: Guo, Yiwei, et al.
Published: (2024)
by: Guo, Yiwei, et al.
Published: (2024)
Distilling Out-of-Distribution Robustness from Vision-Language Foundation Models
by: Zhou, Andy, et al.
Published: (2023)
by: Zhou, Andy, et al.
Published: (2023)
GEMS: Agent-Native Multimodal Generation with Memory and Skills
by: He, Zefeng, et al.
Published: (2026)
by: He, Zefeng, et al.
Published: (2026)
Autonomous Evaluation and Refinement of Digital Agents
by: Pan, Jiayi, et al.
Published: (2024)
by: Pan, Jiayi, et al.
Published: (2024)
CPathAgent: An Agent-based Foundation Model for Interpretable High-Resolution Pathology Image Analysis Mimicking Pathologists' Diagnostic Logic
by: Sun, Yuxuan, et al.
Published: (2025)
by: Sun, Yuxuan, et al.
Published: (2025)
Language Agent Tree Search Unifies Reasoning Acting and Planning in Language Models
by: Zhou, Andy, et al.
Published: (2023)
by: Zhou, Andy, et al.
Published: (2023)
SegLocNet: Multimodal Localization Network for Autonomous Driving via Bird's-Eye-View Segmentation
by: Zhou, Zijie, et al.
Published: (2025)
by: Zhou, Zijie, et al.
Published: (2025)
WHALES: A Multi-Agent Scheduling Dataset for Enhanced Cooperation in Autonomous Driving
by: Wang, Yinsong, et al.
Published: (2024)
by: Wang, Yinsong, et al.
Published: (2024)
WorldAgents: Can Foundation Image Models be Agents for 3D World Models?
by: Erkoç, Ziya, et al.
Published: (2026)
by: Erkoç, Ziya, et al.
Published: (2026)
Swiss Army Knife: Synergizing Biases in Knowledge from Vision Foundation Models for Multi-Task Learning
by: Lu, Yuxiang, et al.
Published: (2024)
by: Lu, Yuxiang, et al.
Published: (2024)
AnySkill: Learning Open-Vocabulary Physical Skill for Interactive Agents
by: Cui, Jieming, et al.
Published: (2024)
by: Cui, Jieming, et al.
Published: (2024)
VisualAgentBench: Towards Large Multimodal Models as Visual Foundation Agents
by: Liu, Xiao, et al.
Published: (2024)
by: Liu, Xiao, et al.
Published: (2024)
Learning Visuotactile Skills with Two Multifingered Hands
by: Lin, Toru, et al.
Published: (2024)
by: Lin, Toru, et al.
Published: (2024)
RestoreAgent: Autonomous Image Restoration Agent via Multimodal Large Language Models
by: Chen, Haoyu, et al.
Published: (2024)
by: Chen, Haoyu, et al.
Published: (2024)
UItron: Foundational GUI Agent with Advanced Perception and Planning
by: Zeng, Zhixiong, et al.
Published: (2025)
by: Zeng, Zhixiong, et al.
Published: (2025)
MAI-UI Technical Report: Real-World Centric Foundation GUI Agents
by: Zhou, Hanzhang, et al.
Published: (2025)
by: Zhou, Hanzhang, et al.
Published: (2025)
Agent0-VL: Exploring Self-Evolving Agent for Tool-Integrated Vision-Language Reasoning
by: Liu, Jiaqi, et al.
Published: (2025)
by: Liu, Jiaqi, et al.
Published: (2025)
CPN: Complementary Proposal Network for Unconstrained Text Detection
by: Wu, Longhuang, et al.
Published: (2024)
by: Wu, Longhuang, et al.
Published: (2024)
LT-Gaussian: Long-Term Map Update Using 3D Gaussian Splatting for Autonomous Driving
by: Cheng, Luqi, et al.
Published: (2025)
by: Cheng, Luqi, et al.
Published: (2025)
Planner3D: LLM-enhanced graph prior meets 3D indoor scene explicit regularization
by: Wei, Yao, et al.
Published: (2024)
by: Wei, Yao, et al.
Published: (2024)
AgentFoX: LLM Agent-Guided Fusion with eXplainability for AI-Generated Image Detection
by: Yu, Yangxin, et al.
Published: (2026)
by: Yu, Yangxin, et al.
Published: (2026)
Agent Skills Should Go Beyond Text: The Case for Visual Skills
by: Xu, Binxiao, et al.
Published: (2026)
by: Xu, Binxiao, et al.
Published: (2026)
HiconAgent: History Context-aware Policy Optimization for GUI Agents
by: Zhou, Xurui, et al.
Published: (2025)
by: Zhou, Xurui, et al.
Published: (2025)
AgentThink: A Unified Framework for Tool-Augmented Chain-of-Thought Reasoning in Vision-Language Models for Autonomous Driving
by: Qian, Kangan, et al.
Published: (2025)
by: Qian, Kangan, et al.
Published: (2025)
Walk through Paintings: Egocentric World Models from Internet Priors
by: Bagchi, Anurag, et al.
Published: (2026)
by: Bagchi, Anurag, et al.
Published: (2026)
Towards Long-horizon Embodied Agents with Tool-Aligned Vision-Language-Action Models
by: Lei, Zixing, et al.
Published: (2026)
by: Lei, Zixing, et al.
Published: (2026)
HY-Embodied-0.5: Embodied Foundation Models for Real-World Agents
by: X, Tencent Robotics, et al.
Published: (2026)
by: X, Tencent Robotics, et al.
Published: (2026)
IV-Mixed Sampler: Leveraging Image Diffusion Models for Enhanced Video Synthesis
by: Shao, Shitong, et al.
Published: (2024)
by: Shao, Shitong, et al.
Published: (2024)
AdaFusion: Prompt-Guided Inference with Adaptive Fusion of Pathology Foundation Models
by: Xiao, Yuxiang, et al.
Published: (2025)
by: Xiao, Yuxiang, et al.
Published: (2025)
Applications of Large Scale Foundation Models for Autonomous Driving
by: Huang, Yu, et al.
Published: (2023)
by: Huang, Yu, et al.
Published: (2023)
Fine-Grained Evaluation of Large Vision-Language Models in Autonomous Driving
by: Li, Yue, et al.
Published: (2025)
by: Li, Yue, et al.
Published: (2025)
Geometry-Guided Modeling of Foundation Features Enables Generalizable Object Shape Deformation Learning
by: Ma, Yiyao, et al.
Published: (2026)
by: Ma, Yiyao, et al.
Published: (2026)
Similar Items
-
ATraDiff: Accelerating Online Reinforcement Learning with Imaginary Trajectories
by: Yang, Qianlan, et al.
Published: (2024) -
AffordanceLLM: Grounding Affordance from Vision Language Models
by: Qian, Shengyi, et al.
Published: (2024) -
ViGoR: Improving Visual Grounding of Large Vision Language Models with Fine-Grained Reward Modeling
by: Yan, Siming, et al.
Published: (2024) -
Digi-Q: Learning Q-Value Functions for Training Device-Control Agents
by: Bai, Hao, et al.
Published: (2025) -
Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning
by: Zhai, Yuexiang, et al.
Published: (2024)