VisualWebBench: How Far Have Multimodal LLMs Evolved in Web Page Understanding and Grounding?
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Junpeng, Song, Yifan, Lin, Bill Yuchen, Lam, Wai, Neubig, Graham, Li, Yuanzhi, Yue, Xiang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Harnessing Webpage UIs for Text-Rich Visual Understanding
di: Liu, Junpeng, et al.
Pubblicazione: (2024)
di: Liu, Junpeng, et al.
Pubblicazione: (2024)
VisualWebArena: Evaluating Multimodal Agents on Realistic Visual Web Tasks
di: Koh, Jing Yu, et al.
Pubblicazione: (2024)
di: Koh, Jing Yu, et al.
Pubblicazione: (2024)
Grounding Multilingual Multimodal LLMs With Cultural Knowledge
di: Nyandwi, Jean de Dieu, et al.
Pubblicazione: (2025)
di: Nyandwi, Jean de Dieu, et al.
Pubblicazione: (2025)
Go-Browse: Training Web Agents with Structured Exploration
di: Gandhi, Apurva, et al.
Pubblicazione: (2025)
di: Gandhi, Apurva, et al.
Pubblicazione: (2025)
Beyond Browsing: API-Based Web Agents
di: Song, Yueqi, et al.
Pubblicazione: (2024)
di: Song, Yueqi, et al.
Pubblicazione: (2024)
WebVR: Benchmarking Multimodal LLMs for WebPage Recreation from Videos via Human-Aligned Visual Rubrics
di: Dai, Yuhong, et al.
Pubblicazione: (2026)
di: Dai, Yuhong, et al.
Pubblicazione: (2026)
What Is Missing in Multilingual Visual Reasoning and How to Fix It
di: Song, Yueqi, et al.
Pubblicazione: (2024)
di: Song, Yueqi, et al.
Pubblicazione: (2024)
VisualPuzzles: Decoupling Multimodal Reasoning Evaluation from Domain Knowledge
di: Song, Yueqi, et al.
Pubblicazione: (2025)
di: Song, Yueqi, et al.
Pubblicazione: (2025)
WebQuest: A Benchmark for Multimodal QA on Web Page Sequences
di: Wang, Maria, et al.
Pubblicazione: (2024)
di: Wang, Maria, et al.
Pubblicazione: (2024)
VisualWebInstruct: Scaling up Multimodal Instruction Data through Web Search
di: Jia, Yiming, et al.
Pubblicazione: (2025)
di: Jia, Yiming, et al.
Pubblicazione: (2025)
Web Page Classification using LLMs for Crawling Support
di: Sasazawa, Yuichi, et al.
Pubblicazione: (2025)
di: Sasazawa, Yuichi, et al.
Pubblicazione: (2025)
Implementation of Web Page Suggestion in Web mining
di: Gupta, Aparna N., et al.
Pubblicazione: (2014)
di: Gupta, Aparna N., et al.
Pubblicazione: (2014)
Web Page Design.
di: Lindsay, Lorin
Pubblicazione: (1996)
di: Lindsay, Lorin
Pubblicazione: (1996)
Parent-Friendly Web Pages.
di: Farmer, Lesley S. J.
Pubblicazione: (2000)
di: Farmer, Lesley S. J.
Pubblicazione: (2000)
Demystifying Long Chain-of-Thought Reasoning in LLMs
di: Yeo, Edward, et al.
Pubblicazione: (2025)
di: Yeo, Edward, et al.
Pubblicazione: (2025)
On the Interplay of Pre-Training, Mid-Training, and RL on Reasoning Language Models
di: Zhang, Charlie, et al.
Pubblicazione: (2025)
di: Zhang, Charlie, et al.
Pubblicazione: (2025)
Needle in the Web: A Benchmark for Retrieving Targeted Web Pages in the Wild
di: Wang, Yumeng, et al.
Pubblicazione: (2025)
di: Wang, Yumeng, et al.
Pubblicazione: (2025)
OVO-Bench: How Far is Your Video-LLMs from Real-World Online Video Understanding?
di: Li, Yifei, et al.
Pubblicazione: (2025)
di: Li, Yifei, et al.
Pubblicazione: (2025)
How Far Have LLMs Come Toward Automated SATD Taxonomy Construction?
di: Nakashima, Sota, et al.
Pubblicazione: (2025)
di: Nakashima, Sota, et al.
Pubblicazione: (2025)
Adding Sound and Video to Web Pages.
di: Duval, Beverly K., et al.
Pubblicazione: (1997)
di: Duval, Beverly K., et al.
Pubblicazione: (1997)
Database-Backed Library Web Pages.
di: Westman, Stephen
Pubblicazione: (2001)
di: Westman, Stephen
Pubblicazione: (2001)
The Good, The Bad, and The Greedy: Evaluation of LLMs Should Not Ignore Non-Determinism
di: Song, Yifan, et al.
Pubblicazione: (2024)
di: Song, Yifan, et al.
Pubblicazione: (2024)
SimulBench: Evaluating Language Models with Creative Simulation Tasks
di: Jia, Qi, et al.
Pubblicazione: (2024)
di: Jia, Qi, et al.
Pubblicazione: (2024)
WebExplorer: Explore and Evolve for Training Long-Horizon Web Agents
di: Liu, Junteng, et al.
Pubblicazione: (2025)
di: Liu, Junteng, et al.
Pubblicazione: (2025)
Avenir-Web: Human-Experience-Imitating Multimodal Web Agents with Mixture of Grounding Experts
di: Li, Aiden Yiliu, et al.
Pubblicazione: (2026)
di: Li, Aiden Yiliu, et al.
Pubblicazione: (2026)
JMMMU: A Japanese Massive Multi-discipline Multimodal Understanding Benchmark for Culture-aware Evaluation
di: Onohara, Shota, et al.
Pubblicazione: (2024)
di: Onohara, Shota, et al.
Pubblicazione: (2024)
WebArena: A Realistic Web Environment for Building Autonomous Agents
di: Zhou, Shuyan, et al.
Pubblicazione: (2023)
di: Zhou, Shuyan, et al.
Pubblicazione: (2023)
AV-Odyssey Bench: Can Your Multimodal LLMs Really Understand Audio-Visual Information?
di: Gong, Kaixiong, et al.
Pubblicazione: (2024)
di: Gong, Kaixiong, et al.
Pubblicazione: (2024)
Augmenting Web Page Classifiers with Social Annotations
di: Arkaitz Zubiaga
Pubblicazione: (2011)
di: Arkaitz Zubiaga
Pubblicazione: (2011)
Working the Web with a No-Frills "Work Page."
di: Mellendorf, Scott A.
Pubblicazione: (1996)
di: Mellendorf, Scott A.
Pubblicazione: (1996)
An Analysis of Academic Library Web Pages for Faculty
di: Gardner, Susan J., et al.
Pubblicazione: (2008)
di: Gardner, Susan J., et al.
Pubblicazione: (2008)
Genesis: Evolving Attack Strategies for LLM Web Agent Red-Teaming
di: Zhang, Zheng, et al.
Pubblicazione: (2025)
di: Zhang, Zheng, et al.
Pubblicazione: (2025)
Untangling the Web of Legislative Histories: A Web Page for Bibliographic Instruction on the Legislative Process.
di: Hoffman, Elaine
Pubblicazione: (1997)
di: Hoffman, Elaine
Pubblicazione: (1997)
Do RESTful API Design Rules Have an Impact on the Understandability of Web APIs? A Web-Based Experiment with API Descriptions
di: Bogner, Justus, et al.
Pubblicazione: (2023)
di: Bogner, Justus, et al.
Pubblicazione: (2023)
How Far Have We Gone in Binary Code Understanding Using Large Language Models
di: Shang, Xiuwei, et al.
Pubblicazione: (2024)
di: Shang, Xiuwei, et al.
Pubblicazione: (2024)
Portfolio Assessment: How Far Have We Come?
di: Brown, Carol A.
Pubblicazione: (2002)
di: Brown, Carol A.
Pubblicazione: (2002)
Dual-View Visual Contextualization for Web Navigation
di: Kil, Jihyung, et al.
Pubblicazione: (2024)
di: Kil, Jihyung, et al.
Pubblicazione: (2024)
IW-Bench: Evaluating Large Multimodal Models for Converting Image-to-Web
di: Guo, Hongcheng, et al.
Pubblicazione: (2024)
di: Guo, Hongcheng, et al.
Pubblicazione: (2024)
WebGen-V Bench: Structured Representation for Enhancing Visual Design in LLM-based Web Generation and Evaluation
di: Wang, Kuang-Da, et al.
Pubblicazione: (2025)
di: Wang, Kuang-Da, et al.
Pubblicazione: (2025)
MolmoWeb: Open Visual Web Agent and Open Data for the Open Web
di: Gupta, Tanmay, et al.
Pubblicazione: (2026)
di: Gupta, Tanmay, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Harnessing Webpage UIs for Text-Rich Visual Understanding
di: Liu, Junpeng, et al.
Pubblicazione: (2024) -
VisualWebArena: Evaluating Multimodal Agents on Realistic Visual Web Tasks
di: Koh, Jing Yu, et al.
Pubblicazione: (2024) -
Grounding Multilingual Multimodal LLMs With Cultural Knowledge
di: Nyandwi, Jean de Dieu, et al.
Pubblicazione: (2025) -
Go-Browse: Training Web Agents with Structured Exploration
di: Gandhi, Apurva, et al.
Pubblicazione: (2025) -
Beyond Browsing: API-Based Web Agents
di: Song, Yueqi, et al.
Pubblicazione: (2024)