Learning to Adapt: Self-Improving Web Agent via Cognitive-Aware Exploration
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Weile, Miao, Bingchen, Yu, Qifan, Bu, Wendong, Wang, Guoming, Zhang, Wenqiao, Zhang, Shengyu, Li, Juncheng, Tang, Siliang |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CORE: Code-based Inverse Self-Training Framework with Graph Expansion for Virtual Agents
par: Wang, Keyu, et autres
Publié: (2026)
par: Wang, Keyu, et autres
Publié: (2026)
Boosting Virtual Agent Learning and Reasoning: A Step-Wise, Multi-Dimensional, and Generalist Reward Model with Benchmark
par: Miao, Bingchen, et autres
Publié: (2025)
par: Miao, Bingchen, et autres
Publié: (2025)
WiseEdit: Benchmarking Cognition- and Creativity-Informed Image Editing
par: Pan, Kaihang, et autres
Publié: (2025)
par: Pan, Kaihang, et autres
Publié: (2025)
What Limits Virtual Agent Application? OmniBench: A Scalable Multi-Dimensional Benchmark for Essential Virtual Agent Capabilities
par: Bu, Wendong, et autres
Publié: (2025)
par: Bu, Wendong, et autres
Publié: (2025)
OmniMoGen: Unifying Human Motion Generation via Learning from Interleaved Text-Motion Instructions
par: Bu, Wendong, et autres
Publié: (2025)
par: Bu, Wendong, et autres
Publié: (2025)
Generalist Virtual Agents: A Survey on Autonomous Agents Across Digital Platforms
par: Gao, Minghe, et autres
Publié: (2024)
par: Gao, Minghe, et autres
Publié: (2024)
SOYO: A Tuning-Free Approach for Video Style Morphing via Style-Adaptive Interpolation in Diffusion Models
par: Zheng, Haoyu, et autres
Publié: (2025)
par: Zheng, Haoyu, et autres
Publié: (2025)
Towards Meta-Cognitive Knowledge Editing for Multimodal LLMs
par: Fan, Zhaoyu, et autres
Publié: (2025)
par: Fan, Zhaoyu, et autres
Publié: (2025)
Robust Modality-incomplete Anomaly Detection: A Modality-instructive Framework with Benchmark
par: Miao, Bingchen, et autres
Publié: (2024)
par: Miao, Bingchen, et autres
Publié: (2024)
Mastering Collaborative Multi-modal Data Selection: A Focus on Informativeness, Uniqueness, and Representativeness
par: Yu, Qifan, et autres
Publié: (2024)
par: Yu, Qifan, et autres
Publié: (2024)
De-fine: Decomposing and Refining Visual Programs with Auto-Feedback
par: Gao, Minghe, et autres
Publié: (2023)
par: Gao, Minghe, et autres
Publié: (2023)
HarmonyGuard: Toward Safety and Utility in Web Agents via Adaptive Policy Enhancement and Dual-Objective Optimization
par: Chen, Yurun, et autres
Publié: (2025)
par: Chen, Yurun, et autres
Publié: (2025)
World-Model-Augmented Web Agents with Action Correction
par: Shen, Zhouzhou, et autres
Publié: (2026)
par: Shen, Zhouzhou, et autres
Publié: (2026)
Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining
par: Ge, Zhiqi, et autres
Publié: (2024)
par: Ge, Zhiqi, et autres
Publié: (2024)
Training LLM Agents for Spontaneous, Reward-Free Self-Evolution via World Knowledge Exploration
par: Zhang, Qifan, et autres
Publié: (2026)
par: Zhang, Qifan, et autres
Publié: (2026)
MAKIMA: Tuning-free Multi-Attribute Open-domain Video Editing via Mask-Guided Attention Modulation
par: Zheng, Haoyu, et autres
Publié: (2024)
par: Zheng, Haoyu, et autres
Publié: (2024)
WorldGPT: Empowering LLM as Multimodal World Model
par: Ge, Zhiqi, et autres
Publié: (2024)
par: Ge, Zhiqi, et autres
Publié: (2024)
Janus-Pro-R1: Advancing Collaborative Visual Comprehension and Generation via Reinforcement Learning
par: Pan, Kaihang, et autres
Publié: (2025)
par: Pan, Kaihang, et autres
Publié: (2025)
InstructSAM: Segment Any Instance with Any Instructions
par: Yuan, Yuqian, et autres
Publié: (2026)
par: Yuan, Yuqian, et autres
Publié: (2026)
FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL
par: Pan, Kaihang, et autres
Publié: (2025)
par: Pan, Kaihang, et autres
Publié: (2025)
Towards Unified Multimodal Editing with Enhanced Knowledge Collaboration
par: Pan, Kaihang, et autres
Publié: (2024)
par: Pan, Kaihang, et autres
Publié: (2024)
PILOT: Planning via Internalized Latent Optimization Trajectories for Large Language Models
par: Zheng, Haoyu, et autres
Publié: (2026)
par: Zheng, Haoyu, et autres
Publié: (2026)
Evaluating the Robustness of Multimodal Agents Against Active Environmental Injection Attacks
par: Chen, Yurun, et autres
Publié: (2025)
par: Chen, Yurun, et autres
Publié: (2025)
Intelligent Model Update Strategy for Sequential Recommendation
par: Lv, Zheqi, et autres
Publié: (2023)
par: Lv, Zheqi, et autres
Publié: (2023)
MoA: Heterogeneous Mixture of Adapters for Parameter-Efficient Fine-Tuning of Large Language Models
par: Cao, Jie, et autres
Publié: (2025)
par: Cao, Jie, et autres
Publié: (2025)
LASER: Tuning-Free LLM-Driven Attention Control for Efficient Text-conditioned Image-to-Animation
par: Zheng, Haoyu, et autres
Publié: (2024)
par: Zheng, Haoyu, et autres
Publié: (2024)
IDEAL: Leveraging Infinite and Dynamic Characterizations of Large Language Models for Query-focused Summarization
par: Cao, Jie, et autres
Publié: (2024)
par: Cao, Jie, et autres
Publié: (2024)
Bridging Local Details and Global Context in Text-Attributed Graphs
par: Wang, Yaoke, et autres
Publié: (2024)
par: Wang, Yaoke, et autres
Publié: (2024)
DuetRAG: Collaborative Retrieval-Augmented Generation
par: Jiao, Dian, et autres
Publié: (2024)
par: Jiao, Dian, et autres
Publié: (2024)
STEP: Enhancing Video-LLMs' Compositional Reasoning by Spatio-Temporal Graph-guided Self-Training
par: Qiu, Haiyi, et autres
Publié: (2024)
par: Qiu, Haiyi, et autres
Publié: (2024)
Towards Physically Executable 3D Gaussian for Embodied Navigation
par: Miao, Bingchen, et autres
Publié: (2025)
par: Miao, Bingchen, et autres
Publié: (2025)
Fine-tuning Multimodal LLMs to Follow Zero-shot Demonstrative Instructions
par: Li, Juncheng, et autres
Publié: (2023)
par: Li, Juncheng, et autres
Publié: (2023)
Fact :Teaching MLLMs with Faithful, Concise and Transferable Rationales
par: Gao, Minghe, et autres
Publié: (2024)
par: Gao, Minghe, et autres
Publié: (2024)
Blow-up suppression for the nematic liquid crystal flow via Couette flow on $\mathbb{R}^2$
par: Chen, Yubo, et autres
Publié: (2026)
par: Chen, Yubo, et autres
Publié: (2026)
Fast Thinking for Large Language Models
par: Zheng, Haoyu, et autres
Publié: (2025)
par: Zheng, Haoyu, et autres
Publié: (2025)
SpatialFusion: Endowing Unified Image Generation with Intrinsic 3D Geometric Awareness
par: Qiu, Haiyi, et autres
Publié: (2026)
par: Qiu, Haiyi, et autres
Publié: (2026)
Align$^2$LLaVA: Cascaded Human and Large Language Model Preference Alignment for Multi-modal Instruction Curation
par: Huang, Hongzhe, et autres
Publié: (2024)
par: Huang, Hongzhe, et autres
Publié: (2024)
Unified Generative and Discriminative Training for Multi-modal Large Language Models
par: Chow, Wei, et autres
Publié: (2024)
par: Chow, Wei, et autres
Publié: (2024)
AnyEdit: Mastering Unified High-Quality Image Editing for Any Idea
par: Yu, Qifan, et autres
Publié: (2024)
par: Yu, Qifan, et autres
Publié: (2024)
Draft-Thinking: Learning Efficient Reasoning in Long Chain-of-Thought LLMs
par: Cao, Jie, et autres
Publié: (2026)
par: Cao, Jie, et autres
Publié: (2026)
Documents similaires
-
CORE: Code-based Inverse Self-Training Framework with Graph Expansion for Virtual Agents
par: Wang, Keyu, et autres
Publié: (2026) -
Boosting Virtual Agent Learning and Reasoning: A Step-Wise, Multi-Dimensional, and Generalist Reward Model with Benchmark
par: Miao, Bingchen, et autres
Publié: (2025) -
WiseEdit: Benchmarking Cognition- and Creativity-Informed Image Editing
par: Pan, Kaihang, et autres
Publié: (2025) -
What Limits Virtual Agent Application? OmniBench: A Scalable Multi-Dimensional Benchmark for Essential Virtual Agent Capabilities
par: Bu, Wendong, et autres
Publié: (2025) -
OmniMoGen: Unifying Human Motion Generation via Learning from Interleaved Text-Motion Instructions
par: Bu, Wendong, et autres
Publié: (2025)