GPT-4V(ision) is a Generalist Web Agent, if Grounded
Fuente:
arXiv
Salvato in:
| Autori principali: | Zheng, Boyuan, Gou, Boyu, Kil, Jihyung, Sun, Huan, Su, Yu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Dual-View Visual Contextualization for Web Navigation
di: Kil, Jihyung, et al.
Pubblicazione: (2024)
di: Kil, Jihyung, et al.
Pubblicazione: (2024)
Navigating the Digital World as Humans Do: Universal Visual Grounding for GUI Agents
di: Gou, Boyu, et al.
Pubblicazione: (2024)
di: Gou, Boyu, et al.
Pubblicazione: (2024)
Attention Grounded Enhancement for Visual Document Retrieval
di: Cui, Wanqing, et al.
Pubblicazione: (2025)
di: Cui, Wanqing, et al.
Pubblicazione: (2025)
E5-V: Universal Embeddings with Multimodal Large Language Models
di: Jiang, Ting, et al.
Pubblicazione: (2024)
di: Jiang, Ting, et al.
Pubblicazione: (2024)
Hierarchical Local-Global Transformer for Temporal Sentence Grounding
di: Fang, Xiang, et al.
Pubblicazione: (2022)
di: Fang, Xiang, et al.
Pubblicazione: (2022)
MemEye: A Visual-Centric Evaluation Framework for Multimodal Agent Memory
di: Guo, Minghao, et al.
Pubblicazione: (2026)
di: Guo, Minghao, et al.
Pubblicazione: (2026)
GPT-4V(ision) for Robotics: Multimodal Task Planning from Human Demonstration
di: Wake, Naoki, et al.
Pubblicazione: (2023)
di: Wake, Naoki, et al.
Pubblicazione: (2023)
VISTA: Visualized Text Embedding For Universal Multi-Modal Retrieval
di: Zhou, Junjie, et al.
Pubblicazione: (2024)
di: Zhou, Junjie, et al.
Pubblicazione: (2024)
Multi-Grained Query-Guided Set Prediction Network for Grounded Multimodal Named Entity Recognition
di: Tang, Jielong, et al.
Pubblicazione: (2024)
di: Tang, Jielong, et al.
Pubblicazione: (2024)
Structural Anchor Pruning: Training-Free Multi-Vector Compression for Visual Document Retrieval
di: Liu, Zhuchenyang, et al.
Pubblicazione: (2026)
di: Liu, Zhuchenyang, et al.
Pubblicazione: (2026)
Harnessing GPT-4V(ision) for Insurance: A Preliminary Exploration
di: Lin, Chenwei, et al.
Pubblicazione: (2024)
di: Lin, Chenwei, et al.
Pubblicazione: (2024)
Towards Text-Image Interleaved Retrieval
di: Zhang, Xin, et al.
Pubblicazione: (2025)
di: Zhang, Xin, et al.
Pubblicazione: (2025)
Design Your Ad: Personalized Advertising Image and Text Generation with Unified Autoregressive Models
di: Xu, Yexing, et al.
Pubblicazione: (2026)
di: Xu, Yexing, et al.
Pubblicazione: (2026)
LITTA: Late-Interaction and Test-Time Alignment for Visually-Grounded Multimodal Retrieval
di: Kim, Seonok
Pubblicazione: (2026)
di: Kim, Seonok
Pubblicazione: (2026)
TIGER-FG: Text-Guided Implicit Fine-Grained Grounding for E-commerce Retrieval
di: Sun, Xinyu, et al.
Pubblicazione: (2026)
di: Sun, Xinyu, et al.
Pubblicazione: (2026)
VideoAgent: Long-form Video Understanding with Large Language Model as Agent
di: Wang, Xiaohan, et al.
Pubblicazione: (2024)
di: Wang, Xiaohan, et al.
Pubblicazione: (2024)
Improving Applicability of Deep Learning based Token Classification models during Training
di: Mehra, Anket, et al.
Pubblicazione: (2025)
di: Mehra, Anket, et al.
Pubblicazione: (2025)
Towards Natural Language-Based Document Image Retrieval: New Dataset and Benchmark
di: Guo, Hao, et al.
Pubblicazione: (2025)
di: Guo, Hao, et al.
Pubblicazione: (2025)
Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture
di: Zhang, Longxiang, et al.
Pubblicazione: (2026)
di: Zhang, Longxiang, et al.
Pubblicazione: (2026)
ITEm: Unsupervised Image-Text Embedding Learning for eCommerce
di: Liao, Baohao, et al.
Pubblicazione: (2023)
di: Liao, Baohao, et al.
Pubblicazione: (2023)
Visual Late Chunking: An Empirical Study of Contextual Chunking for Efficient Visual Document Retrieval
di: Yan, Yibo, et al.
Pubblicazione: (2026)
di: Yan, Yibo, et al.
Pubblicazione: (2026)
Sculpting the Vector Space: Towards Efficient Multi-Vector Visual Document Retrieval via Prune-then-Merge Framework
di: Yan, Yibo, et al.
Pubblicazione: (2026)
di: Yan, Yibo, et al.
Pubblicazione: (2026)
Windsock is Dancing: Adaptive Multimodal Retrieval-Augmented Generation
di: Zhao, Shu, et al.
Pubblicazione: (2025)
di: Zhao, Shu, et al.
Pubblicazione: (2025)
Seeing Through the MiRAGE: Evaluating Multimodal Retrieval Augmented Generation
di: Martin, Alexander, et al.
Pubblicazione: (2025)
di: Martin, Alexander, et al.
Pubblicazione: (2025)
Personal Visual Memory from Explicit and Implicit Evidence
di: Nguyen, Viet, et al.
Pubblicazione: (2026)
di: Nguyen, Viet, et al.
Pubblicazione: (2026)
Supervised Fine-Tuning or Contrastive Learning? Towards Better Multimodal LLM Reranking
di: Dai, Ziqi, et al.
Pubblicazione: (2025)
di: Dai, Ziqi, et al.
Pubblicazione: (2025)
Large Language Model Informed Patent Image Retrieval
di: Lo, Hao-Cheng, et al.
Pubblicazione: (2024)
di: Lo, Hao-Cheng, et al.
Pubblicazione: (2024)
CollEX -- A Multimodal Agentic RAG System Enabling Interactive Exploration of Scientific Collections
di: Schneider, Florian, et al.
Pubblicazione: (2025)
di: Schneider, Florian, et al.
Pubblicazione: (2025)
TransientTables: Evaluating LLMs' Reasoning on Temporally Evolving Semi-structured Tables
di: Shankarampeta, Abhilash, et al.
Pubblicazione: (2025)
di: Shankarampeta, Abhilash, et al.
Pubblicazione: (2025)
Are We on the Right Way for Assessing Document Retrieval-Augmented Generation?
di: Shen, Wenxuan, et al.
Pubblicazione: (2025)
di: Shen, Wenxuan, et al.
Pubblicazione: (2025)
ColPali: Efficient Document Retrieval with Vision Language Models
di: Faysse, Manuel, et al.
Pubblicazione: (2024)
di: Faysse, Manuel, et al.
Pubblicazione: (2024)
InterLV-Search: Benchmarking Interleaved Multimodal Agentic Search
di: Hou, Bohan, et al.
Pubblicazione: (2026)
di: Hou, Bohan, et al.
Pubblicazione: (2026)
Indexing Multimodal Language Models for Large-scale Image Retrieval
di: Tharwat, Bahey, et al.
Pubblicazione: (2026)
di: Tharwat, Bahey, et al.
Pubblicazione: (2026)
X-Reflect: Cross-Reflection Prompting for Multimodal Recommendation
di: Lyu, Hanjia, et al.
Pubblicazione: (2024)
di: Lyu, Hanjia, et al.
Pubblicazione: (2024)
Rethinking Composed Image Retrieval Evaluation: A Fine-Grained Benchmark from Image Editing
di: Song, Tingyu, et al.
Pubblicazione: (2026)
di: Song, Tingyu, et al.
Pubblicazione: (2026)
Multi-Vector Index Compression in Any Modality
di: Qin, Hanxiang, et al.
Pubblicazione: (2026)
di: Qin, Hanxiang, et al.
Pubblicazione: (2026)
Benchmarking Retrieval-Augmented Multimodal Generation for Document Question Answering
di: Dong, Kuicai, et al.
Pubblicazione: (2025)
di: Dong, Kuicai, et al.
Pubblicazione: (2025)
CLaMR: Contextualized Late-Interaction for Multimodal Content Retrieval
di: Wan, David, et al.
Pubblicazione: (2025)
di: Wan, David, et al.
Pubblicazione: (2025)
WikiSeeker: Rethinking the Role of Vision-Language Models in Knowledge-Based Visual Question Answering
di: Zhu, Yingjian, et al.
Pubblicazione: (2026)
di: Zhu, Yingjian, et al.
Pubblicazione: (2026)
ReinPool: Reinforcement Learning Pooling Multi-Vector Embeddings for Retrieval System
di: Cha, Sungguk, et al.
Pubblicazione: (2026)
di: Cha, Sungguk, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Dual-View Visual Contextualization for Web Navigation
di: Kil, Jihyung, et al.
Pubblicazione: (2024) -
Navigating the Digital World as Humans Do: Universal Visual Grounding for GUI Agents
di: Gou, Boyu, et al.
Pubblicazione: (2024) -
Attention Grounded Enhancement for Visual Document Retrieval
di: Cui, Wanqing, et al.
Pubblicazione: (2025) -
E5-V: Universal Embeddings with Multimodal Large Language Models
di: Jiang, Ting, et al.
Pubblicazione: (2024) -
Hierarchical Local-Global Transformer for Temporal Sentence Grounding
di: Fang, Xiang, et al.
Pubblicazione: (2022)