See and Remember: A Multimodal Agent for Web Traversal
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Xinjun, Wang, Shengyao, Zhou, Aimin, Hao, Hao |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Avenir-Web: Human-Experience-Imitating Multimodal Web Agents with Mixture of Grounding Experts
par: Li, Aiden Yiliu, et autres
Publié: (2026)
par: Li, Aiden Yiliu, et autres
Publié: (2026)
WebWalker: Benchmarking LLMs in Web Traversal
par: Wu, Jialong, et autres
Publié: (2025)
par: Wu, Jialong, et autres
Publié: (2025)
See and Think: Embodied Agent in Virtual Environment
par: Zhao, Zhonghan, et autres
Publié: (2023)
par: Zhao, Zhonghan, et autres
Publié: (2023)
EA4LLM: A Gradient-Free Approach to Large Language Model Optimization via Evolutionary Algorithms
par: Liu, WenTao, et autres
Publié: (2025)
par: Liu, WenTao, et autres
Publié: (2025)
Drift to Remember
par: Du, Jin, et autres
Publié: (2024)
par: Du, Jin, et autres
Publié: (2024)
See, Plan, Snap: Evaluating Multimodal GUI Agents in Scratch
par: Zhang, Xingyi, et autres
Publié: (2026)
par: Zhang, Xingyi, et autres
Publié: (2026)
Scaling Laws for Educational AI Agents
par: Wu, Mengsong, et autres
Publié: (2026)
par: Wu, Mengsong, et autres
Publié: (2026)
IB-GRPO: Aligning LLM-based Learning Path Recommendation with Educational Objectives via Indicator-Based Group Relative Policy Optimization
par: Wang, Shuai, et autres
Publié: (2026)
par: Wang, Shuai, et autres
Publié: (2026)
Remember the Decision, Not the Description: A Rate-Distortion Framework for Agent Memory
par: Zou, Mingxi, et autres
Publié: (2026)
par: Zou, Mingxi, et autres
Publié: (2026)
Evolutionary Retrosynthetic Route Planning
par: Zhang, Yan, et autres
Publié: (2023)
par: Zhang, Yan, et autres
Publié: (2023)
Automating Skill Acquisition through Large-Scale Mining of Open-Source Agentic Repositories: A Framework for Multi-Agent Procedural Knowledge Extraction
par: Bi, Shuzhen, et autres
Publié: (2026)
par: Bi, Shuzhen, et autres
Publié: (2026)
Back to Basics: Let Conversational Agents Remember with Just Retrieval and Generation
par: Wu, Yuqian, et autres
Publié: (2026)
par: Wu, Yuqian, et autres
Publié: (2026)
Inductive Cognitive Diagnosis for Fast Student Learning in Web-Based Online Intelligent Education Systems
par: Liu, Shuo, et autres
Publié: (2024)
par: Liu, Shuo, et autres
Publié: (2024)
MM-WebAgent: A Hierarchical Multimodal Web Agent for Webpage Generation
par: Li, Yan, et autres
Publié: (2026)
par: Li, Yan, et autres
Publié: (2026)
OpAgent: Operator Agent for Web Navigation
par: Guo, Yuyu, et autres
Publié: (2026)
par: Guo, Yuyu, et autres
Publié: (2026)
Genesis: Evolving Attack Strategies for LLM Web Agent Red-Teaming
par: Zhang, Zheng, et autres
Publié: (2025)
par: Zhang, Zheng, et autres
Publié: (2025)
StressWeb: A Diagnostic Benchmark for Web Agent Robustness under Realistic Interaction Variability
par: Bai, Haoyue, et autres
Publié: (2026)
par: Bai, Haoyue, et autres
Publié: (2026)
Choosing How to Remember: Adaptive Memory Structures for LLM Agents
par: Lu, Mingfei, et autres
Publié: (2026)
par: Lu, Mingfei, et autres
Publié: (2026)
MultiMind: Enhancing Werewolf Agents with Multimodal Reasoning and Theory of Mind
par: Zhang, Zheng, et autres
Publié: (2025)
par: Zhang, Zheng, et autres
Publié: (2025)
DECEPTICON: How Dark Patterns Manipulate Web Agents
par: Cuvin, Phil, et autres
Publié: (2025)
par: Cuvin, Phil, et autres
Publié: (2025)
ClimAgent: LLM as Agents for Autonomous Open-ended Climate Science Analysis
par: Wang, Hao, et autres
Publié: (2026)
par: Wang, Hao, et autres
Publié: (2026)
EvoAgent: An Evolvable Agent Framework with Skill Learning and Multi-Agent Delegation
par: Zhang, Aimin, et autres
Publié: (2026)
par: Zhang, Aimin, et autres
Publié: (2026)
Evo-MedAgent: Beyond One-Shot Diagnosis with Agents That Remember, Reflect, and Improve
par: Shen, Weixiang, et autres
Publié: (2026)
par: Shen, Weixiang, et autres
Publié: (2026)
SID: Benchmarking Guided Instruction Capabilities in STEM Education with a Socratic Interdisciplinary Dialogues Dataset
par: Jiang, Mei, et autres
Publié: (2025)
par: Jiang, Mei, et autres
Publié: (2025)
DRIVE: Modeling Skills at the Reasoning and Interaction Levels for Web Agents under Continual Learning
par: Liu, Xirui, et autres
Publié: (2026)
par: Liu, Xirui, et autres
Publié: (2026)
AgentSense: LLMs Empower Generalizable and Explainable Web-Based Participatory Urban Sensing
par: Guo, Xusen, et autres
Publié: (2025)
par: Guo, Xusen, et autres
Publié: (2025)
Uncertainty-Aware GUI Agent: Adaptive Perception through Component Recommendation and Human-in-the-Loop Refinement
par: Hao, Chao, et autres
Publié: (2025)
par: Hao, Chao, et autres
Publié: (2025)
Anticipatory Planning for Multimodal AI Agents
par: Liang, Yongyuan, et autres
Publié: (2026)
par: Liang, Yongyuan, et autres
Publié: (2026)
WebArena: A Realistic Web Environment for Building Autonomous Agents
par: Zhou, Shuyan, et autres
Publié: (2023)
par: Zhou, Shuyan, et autres
Publié: (2023)
Hallucination as Exploit: Evidence-Carrying Multimodal Agents
par: Zhang, Guijia, et autres
Publié: (2026)
par: Zhang, Guijia, et autres
Publié: (2026)
DRSLF: Double Regularized Second-Order Low-Rank Representation for Web Service QoS Prediction
par: Wu, Hao, et autres
Publié: (2025)
par: Wu, Hao, et autres
Publié: (2025)
Learning How to Remember: A Meta-Cognitive Management Method for Structured and Transferable Agent Memory
par: Liang, Sirui, et autres
Publié: (2026)
par: Liang, Sirui, et autres
Publié: (2026)
WebVoyager: Building an End-to-End Web Agent with Large Multimodal Models
par: He, Hongliang, et autres
Publié: (2024)
par: He, Hongliang, et autres
Publié: (2024)
Remember Me, Refine Me: A Dynamic Procedural Memory Framework for Experience-Driven Agent Evolution
par: Cao, Zouying, et autres
Publié: (2025)
par: Cao, Zouying, et autres
Publié: (2025)
InteractWeb-Bench: Can Multimodal Agent Escape Blind Execution in Interactive Website Generation?
par: Wang, Qiyao, et autres
Publié: (2026)
par: Wang, Qiyao, et autres
Publié: (2026)
Thinking on Maps: How Foundation Model Agents Explore, Remember, and Reason Map Environments
par: Wei, Zhiwei, et autres
Publié: (2025)
par: Wei, Zhiwei, et autres
Publié: (2025)
BrowserAgent: Building Web Agents with Human-Inspired Web Browsing Actions
par: Yu, Tao, et autres
Publié: (2025)
par: Yu, Tao, et autres
Publié: (2025)
Multimodal Auto Validation For Self-Refinement in Web Agents
par: Azam, Ruhana, et autres
Publié: (2024)
par: Azam, Ruhana, et autres
Publié: (2024)
Agentmandering: A Game-Theoretic Framework for Fair Redistricting via Large Language Model Agents
par: Li, Hao, et autres
Publié: (2025)
par: Li, Hao, et autres
Publié: (2025)
WebWeaver: Breaking Topology Confidentiality in LLM Multi-Agent Systems with Stealthy Context-Based Inference
par: Xiong, Zixun, et autres
Publié: (2026)
par: Xiong, Zixun, et autres
Publié: (2026)
Documents similaires
-
Avenir-Web: Human-Experience-Imitating Multimodal Web Agents with Mixture of Grounding Experts
par: Li, Aiden Yiliu, et autres
Publié: (2026) -
WebWalker: Benchmarking LLMs in Web Traversal
par: Wu, Jialong, et autres
Publié: (2025) -
See and Think: Embodied Agent in Virtual Environment
par: Zhao, Zhonghan, et autres
Publié: (2023) -
EA4LLM: A Gradient-Free Approach to Large Language Model Optimization via Evolutionary Algorithms
par: Liu, WenTao, et autres
Publié: (2025) -
Drift to Remember
par: Du, Jin, et autres
Publié: (2024)