Ego2Web: A Web Agent Benchmark Grounded in Egocentric Videos
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yu, Shoubin, Shu, Lei, Yang, Antoine, Fu, Yao, Sunkara, Srinivas, Wang, Maria, Chen, Jindong, Bansal, Mohit, Gong, Boqing |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
EgoMemReason: A Memory-Driven Reasoning Benchmark for Long-Horizon Egocentric Video Understanding
par: Wang, Ziyang, et autres
Publié: (2026)
par: Wang, Ziyang, et autres
Publié: (2026)
CREMA: Generalizable and Efficient Video-Language Reasoning via Multimodal Modular Fusion
par: Yu, Shoubin, et autres
Publié: (2024)
par: Yu, Shoubin, et autres
Publié: (2024)
RACCooN: A Versatile Instructional Video Editing Framework with Auto-Generated Narratives
par: Yoon, Jaehong, et autres
Publié: (2024)
par: Yoon, Jaehong, et autres
Publié: (2024)
Exo2EgoDVC: Dense Video Captioning of Egocentric Procedural Activities Using Web Instructional Videos
par: Ohkawa, Takehiko, et autres
Publié: (2023)
par: Ohkawa, Takehiko, et autres
Publié: (2023)
VEGGIE: Instructional Editing and Reasoning Video Concepts with Grounded Generation
par: Yu, Shoubin, et autres
Publié: (2025)
par: Yu, Shoubin, et autres
Publié: (2025)
Video-RTS: Rethinking Reinforcement Learning and Test-Time Scaling for Efficient and Enhanced Video Reasoning
par: Wang, Ziyang, et autres
Publié: (2025)
par: Wang, Ziyang, et autres
Publié: (2025)
Training-free Guidance in Text-to-Video Generation via Multimodal Planning and Structured Noise Initialization
par: Li, Jialu, et autres
Publié: (2025)
par: Li, Jialu, et autres
Publié: (2025)
VisionCoach: Reinforcing Grounded Video Reasoning via Visual-Perception Prompting
par: Lee, Daeun, et autres
Publié: (2026)
par: Lee, Daeun, et autres
Publié: (2026)
VideoTree: Adaptive Tree-based Video Representation for LLM Reasoning on Long Videos
par: Wang, Ziyang, et autres
Publié: (2024)
par: Wang, Ziyang, et autres
Publié: (2024)
VidEgoThink: Assessing Egocentric Video Understanding Capabilities for Embodied AI
par: Cheng, Sijie, et autres
Publié: (2024)
par: Cheng, Sijie, et autres
Publié: (2024)
MEXA: Towards General Multimodal Reasoning with Dynamic Multi-Expert Aggregation
par: Yu, Shoubin, et autres
Publié: (2025)
par: Yu, Shoubin, et autres
Publié: (2025)
When and How Much to Imagine: Adaptive Test-Time Scaling with World Models for Visual Spatial Reasoning
par: Yu, Shoubin, et autres
Publié: (2026)
par: Yu, Shoubin, et autres
Publié: (2026)
STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models
par: Liang, Yiming, et autres
Publié: (2026)
par: Liang, Yiming, et autres
Publié: (2026)
MERRIN: A Benchmark for Multimodal Evidence Retrieval and Reasoning in Noisy Web Environments
par: Wang, Han, et autres
Publié: (2026)
par: Wang, Han, et autres
Publié: (2026)
EgoSound: Benchmarking Sound Understanding in Egocentric Videos
par: Zhu, Bingwen, et autres
Publié: (2026)
par: Zhu, Bingwen, et autres
Publié: (2026)
Fine-grained Spatiotemporal Grounding on Egocentric Videos
par: Liang, Shuo, et autres
Publié: (2025)
par: Liang, Shuo, et autres
Publié: (2025)
EgoBabyVLM: Benchmarking Cross-Modal Learning from Naturalistic Egocentric Video Data
par: Lin, Dongyan, et autres
Publié: (2026)
par: Lin, Dongyan, et autres
Publié: (2026)
Ego-Grounding for Personalized Question-Answering in Egocentric Videos
par: Xiao, Junbin, et autres
Publié: (2026)
par: Xiao, Junbin, et autres
Publié: (2026)
UISim: An Interactive Image-Based UI Simulator for Dynamic Mobile Environments
par: Xiang, Jiannan, et autres
Publié: (2025)
par: Xiang, Jiannan, et autres
Publié: (2025)
WebInject: Prompt Injection Attack to Web Agents
par: Wang, Xilong, et autres
Publié: (2025)
par: Wang, Xilong, et autres
Publié: (2025)
MM-WebAgent: A Hierarchical Multimodal Web Agent for Webpage Generation
par: Li, Yan, et autres
Publié: (2026)
par: Li, Yan, et autres
Publié: (2026)
STAR: A Benchmark for Situated Reasoning in Real-World Videos
par: Wu, Bo, et autres
Publié: (2024)
par: Wu, Bo, et autres
Publié: (2024)
SAFREE: Training-Free and Adaptive Guard for Safe Text-to-Image And Video Generation
par: Yoon, Jaehong, et autres
Publié: (2024)
par: Yoon, Jaehong, et autres
Publié: (2024)
GPT-4V(ision) is a Generalist Web Agent, if Grounded
par: Zheng, Boyuan, et autres
Publié: (2024)
par: Zheng, Boyuan, et autres
Publié: (2024)
WebGuard: Building a Generalizable Guardrail for Web Agents
par: Zheng, Boyuan, et autres
Publié: (2025)
par: Zheng, Boyuan, et autres
Publié: (2025)
VisualWebArena: Evaluating Multimodal Agents on Realistic Visual Web Tasks
par: Koh, Jing Yu, et autres
Publié: (2024)
par: Koh, Jing Yu, et autres
Publié: (2024)
EgoOops: A Dataset for Mistake Action Detection from Egocentric Videos referring to Procedural Texts
par: Haneji, Yuto, et autres
Publié: (2024)
par: Haneji, Yuto, et autres
Publié: (2024)
Unlocking Exocentric Video-Language Data for Egocentric Video Representation Learning
par: Dou, Zi-Yi, et autres
Publié: (2024)
par: Dou, Zi-Yi, et autres
Publié: (2024)
VLN-Video: Utilizing Driving Videos for Outdoor Vision-and-Language Navigation
par: Li, Jialu, et autres
Publié: (2024)
par: Li, Jialu, et autres
Publié: (2024)
RealWebAssist: A Benchmark for Long-Horizon Web Assistance with Real-World Users
par: Ye, Suyu, et autres
Publié: (2025)
par: Ye, Suyu, et autres
Publié: (2025)
ScreenQA: Large-Scale Question-Answer Pairs over Mobile App Screenshots
par: Hsiao, Yu-Chung, et autres
Publié: (2022)
par: Hsiao, Yu-Chung, et autres
Publié: (2022)
Video-Skill-CoT: Skill-based Chain-of-Thoughts for Domain-Adaptive Video Reasoning
par: Lee, Daeun, et autres
Publié: (2025)
par: Lee, Daeun, et autres
Publié: (2025)
SciVideoBench: Benchmarking Scientific Video Reasoning in Large Multimodal Models
par: Deng, Andong, et autres
Publié: (2025)
par: Deng, Andong, et autres
Publié: (2025)
Rephrase, Augment, Reason: Visual Grounding of Questions for Vision-Language Models
par: Prasad, Archiki, et autres
Publié: (2023)
par: Prasad, Archiki, et autres
Publié: (2023)
InfiniteWeb: Scalable Web Environment Synthesis for GUI Agent Training
par: Zhang, Ziyun, et autres
Publié: (2026)
par: Zhang, Ziyun, et autres
Publié: (2026)
EgoNormia: Benchmarking Physical Social Norm Understanding
par: Rezaei, MohammadHossein, et autres
Publié: (2025)
par: Rezaei, MohammadHossein, et autres
Publié: (2025)
OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents
par: Yang, Rui, et autres
Publié: (2026)
par: Yang, Rui, et autres
Publié: (2026)
TimeRefine: Temporal Grounding with Time Refining Video LLM
par: Wang, Xizi, et autres
Publié: (2024)
par: Wang, Xizi, et autres
Publié: (2024)
Tur[k]ingBench: A Challenge Benchmark for Web Agents
par: Xu, Kevin, et autres
Publié: (2024)
par: Xu, Kevin, et autres
Publié: (2024)
Self-Correcting Text-to-Video Generation with Misalignment Detection and Localized Refinement
par: Lee, Daeun, et autres
Publié: (2024)
par: Lee, Daeun, et autres
Publié: (2024)
Documents similaires
-
EgoMemReason: A Memory-Driven Reasoning Benchmark for Long-Horizon Egocentric Video Understanding
par: Wang, Ziyang, et autres
Publié: (2026) -
CREMA: Generalizable and Efficient Video-Language Reasoning via Multimodal Modular Fusion
par: Yu, Shoubin, et autres
Publié: (2024) -
RACCooN: A Versatile Instructional Video Editing Framework with Auto-Generated Narratives
par: Yoon, Jaehong, et autres
Publié: (2024) -
Exo2EgoDVC: Dense Video Captioning of Egocentric Procedural Activities Using Web Instructional Videos
par: Ohkawa, Takehiko, et autres
Publié: (2023) -
VEGGIE: Instructional Editing and Reasoning Video Concepts with Grounded Generation
par: Yu, Shoubin, et autres
Publié: (2025)