VipAct: Visual-Perception Enhancement via Specialized VLM Agent Collaboration and Tool-use
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Zhehao, Rossi, Ryan, Yu, Tong, Dernoncourt, Franck, Zhang, Ruiyi, Gu, Jiuxiang, Kim, Sungchul, Chen, Xiang, Wang, Zichao, Lipka, Nedim |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
A Multi-LLM Debiasing Framework
by: Owens, Deonna M., et al.
Published: (2024)
by: Owens, Deonna M., et al.
Published: (2024)
Optimizing Data Delivery: Insights from User Preferences on Visuals, Tables, and Text
by: Luera, Reuben, et al.
Published: (2024)
by: Luera, Reuben, et al.
Published: (2024)
Trust but Verify: Introducing DAVinCI -- A Framework for Dual Attribution and Verification in Claim Inference for Language Models
by: Rawte, Vipula, et al.
Published: (2026)
by: Rawte, Vipula, et al.
Published: (2026)
MLLM as a UI Judge: Benchmarking Multimodal LLMs for Predicting Human Perception of User Interfaces
by: Luera, Reuben A., et al.
Published: (2025)
by: Luera, Reuben A., et al.
Published: (2025)
Document Attribution: Examining Citation Relationships using Large Language Models
by: Rawte, Vipula, et al.
Published: (2025)
by: Rawte, Vipula, et al.
Published: (2025)
LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding
by: Zhang, Yanzhe, et al.
Published: (2023)
by: Zhang, Yanzhe, et al.
Published: (2023)
ChartLens: Fine-grained Visual Attribution in Charts
by: Suri, Manan, et al.
Published: (2025)
by: Suri, Manan, et al.
Published: (2025)
Personalization of Large Language Models: A Survey
by: Zhang, Zhehao, et al.
Published: (2024)
by: Zhang, Zhehao, et al.
Published: (2024)
Survey of User Interface Design and Interaction Techniques in Generative AI Applications
by: Luera, Reuben, et al.
Published: (2024)
by: Luera, Reuben, et al.
Published: (2024)
Reasoning-Based Personalized Generation for Users with Sparse Data
by: Ni, Bo, et al.
Published: (2026)
by: Ni, Bo, et al.
Published: (2026)
A Framework for Fine-Tuning LLMs using Heterogeneous Feedback
by: Aponte, Ryan, et al.
Published: (2024)
by: Aponte, Ryan, et al.
Published: (2024)
Structured Uncertainty guided Clarification for LLM Agents
by: Suri, Manan, et al.
Published: (2025)
by: Suri, Manan, et al.
Published: (2025)
SV-RAG: LoRA-Contextualizing Adaptation of MLLMs for Long Document Understanding
by: Chen, Jian, et al.
Published: (2024)
by: Chen, Jian, et al.
Published: (2024)
OATS: Opinion Aspect Target Sentiment Quadruple Extraction Dataset for Aspect-Based Sentiment Analysis
by: Chebolu, Siva Uday Sampreeth, et al.
Published: (2023)
by: Chebolu, Siva Uday Sampreeth, et al.
Published: (2023)
ROAST: Review-level Opinion Aspect Sentiment Target Joint Detection for ABSA
by: Chebolu, Siva Uday Sampreeth, et al.
Published: (2024)
by: Chebolu, Siva Uday Sampreeth, et al.
Published: (2024)
Follow the Flow: Fine-grained Flowchart Attribution with Neurosymbolic Agents
by: Suri, Manan, et al.
Published: (2025)
by: Suri, Manan, et al.
Published: (2025)
Cluster-R1: Large Reasoning Models Are Instruction-following Clustering Agents
by: Qing, Peijun, et al.
Published: (2026)
by: Qing, Peijun, et al.
Published: (2026)
KaPQA: Knowledge-Augmented Product Question-Answering
by: Eppalapally, Swetha, et al.
Published: (2024)
by: Eppalapally, Swetha, et al.
Published: (2024)
Towards Visual Text Grounding of Multimodal Large Language Model
by: Li, Ming, et al.
Published: (2025)
by: Li, Ming, et al.
Published: (2025)
Knowledge Homophily in Large Language Models
by: Sahu, Utkarsh, et al.
Published: (2025)
by: Sahu, Utkarsh, et al.
Published: (2025)
Self-Debiasing Large Language Models: Zero-Shot Recognition and Reduction of Stereotypes
by: Gallegos, Isabel O., et al.
Published: (2024)
by: Gallegos, Isabel O., et al.
Published: (2024)
Mixture of Structural-and-Textual Retrieval over Text-rich Graph Knowledge Bases
by: Lei, Yongjia, et al.
Published: (2025)
by: Lei, Yongjia, et al.
Published: (2025)
MODS: Moderating a Mixture of Document Speakers to Summarize Debatable Queries in Document Collections
by: Balepur, Nishant, et al.
Published: (2025)
by: Balepur, Nishant, et al.
Published: (2025)
Customization Assistant for Text-to-image Generation
by: Zhou, Yufan, et al.
Published: (2023)
by: Zhou, Yufan, et al.
Published: (2023)
Test-Time Strategies for More Efficient and Accurate Agentic RAG
by: Zhang, Brian, et al.
Published: (2026)
by: Zhang, Brian, et al.
Published: (2026)
Bias and Fairness in Large Language Models: A Survey
by: Gallegos, Isabel O., et al.
Published: (2023)
by: Gallegos, Isabel O., et al.
Published: (2023)
DynaSaur: Large Language Agents Beyond Predefined Actions
by: Nguyen, Dang, et al.
Published: (2024)
by: Nguyen, Dang, et al.
Published: (2024)
Blind to the Human Touch: Overlap Bias in LLM-Based Summary Evaluation
by: Fang, Jiangnan, et al.
Published: (2026)
by: Fang, Jiangnan, et al.
Published: (2026)
MMR: Evaluating Reading Ability of Large Multimodal Models
by: Chen, Jian, et al.
Published: (2024)
by: Chen, Jian, et al.
Published: (2024)
LaMP-Cap: Personalized Figure Caption Generation With Multimodal Figure Profiles
by: Ng, Ho Yin 'Sam', et al.
Published: (2025)
by: Ng, Ho Yin 'Sam', et al.
Published: (2025)
ChartCitor: Multi-Agent Framework for Fine-Grained Chart Visual Attribution
by: Goswami, Kanika, et al.
Published: (2025)
by: Goswami, Kanika, et al.
Published: (2025)
Personalized Multimodal Large Language Models: A Survey
by: Wu, Junda, et al.
Published: (2024)
by: Wu, Junda, et al.
Published: (2024)
Efficient Tree-Structured Deep Research with Adaptive Resource Allocation
by: Nie, Lunyiu, et al.
Published: (2025)
by: Nie, Lunyiu, et al.
Published: (2025)
PlotGen: Multi-Agent LLM-based Scientific Data Visualization via Multimodal Feedback
by: Goswami, Kanika, et al.
Published: (2025)
by: Goswami, Kanika, et al.
Published: (2025)
A Survey of Small Language Models
by: Van Nguyen, Chien, et al.
Published: (2024)
by: Van Nguyen, Chien, et al.
Published: (2024)
LongLaMP: A Benchmark for Personalized Long-form Text Generation
by: Kumar, Ishita, et al.
Published: (2024)
by: Kumar, Ishita, et al.
Published: (2024)
Augmenting Textual Generation via Topology Aware Retrieval
by: Wang, Yu, et al.
Published: (2024)
by: Wang, Yu, et al.
Published: (2024)
Decomposition-Enhanced Training for Post-Hoc Attributions In Language Models
by: Balasubramanian, Sriram, et al.
Published: (2025)
by: Balasubramanian, Sriram, et al.
Published: (2025)
Toffee: Efficient Million-Scale Dataset Construction for Subject-Driven Text-to-Image Generation
by: Zhou, Yufan, et al.
Published: (2024)
by: Zhou, Yufan, et al.
Published: (2024)
A Survey on LLM-based Conversational User Simulation
by: Ni, Bo, et al.
Published: (2026)
by: Ni, Bo, et al.
Published: (2026)
Similar Items
-
A Multi-LLM Debiasing Framework
by: Owens, Deonna M., et al.
Published: (2024) -
Optimizing Data Delivery: Insights from User Preferences on Visuals, Tables, and Text
by: Luera, Reuben, et al.
Published: (2024) -
Trust but Verify: Introducing DAVinCI -- A Framework for Dual Attribution and Verification in Claim Inference for Language Models
by: Rawte, Vipula, et al.
Published: (2026) -
MLLM as a UI Judge: Benchmarking Multimodal LLMs for Predicting Human Perception of User Interfaces
by: Luera, Reuben A., et al.
Published: (2025) -
Document Attribution: Examining Citation Relationships using Large Language Models
by: Rawte, Vipula, et al.
Published: (2025)