IRIS: Intent Resolution via Inference-time Saccades for Open-Ended VQA in Large Vision-Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Madinei, Parsa, Karmakar, Srijita, Hoffing, Russell Cohen, Gervitz, Felix, Eckstein, Miguel P. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Revealing the Gap in Human and VLM Scene Perception through Counterfactual Semantic Saliency
di: Wen, Ziqi, et al.
Pubblicazione: (2026)
di: Wen, Ziqi, et al.
Pubblicazione: (2026)
DReX: Pure Vision Fusion of Self-Supervised and Convolutional Representations for Image Complexity Prediction
di: Skaza, Jonathan, et al.
Pubblicazione: (2025)
di: Skaza, Jonathan, et al.
Pubblicazione: (2025)
INTERLACE: Interleaved Layer Pruning and Efficient Adaptation in Large Vision-Language Models
di: Madinei, Parsa, et al.
Pubblicazione: (2025)
di: Madinei, Parsa, et al.
Pubblicazione: (2025)
ARChef: An iOS-Based Augmented Reality Cooking Assistant Powered by Multimodal Gemini LLM
di: Vir, Rithik, et al.
Pubblicazione: (2024)
di: Vir, Rithik, et al.
Pubblicazione: (2024)
Impresiones de una exposición / Glora Gervitz
di: Gervitz, Gloria
di: Gervitz, Gloria
Greater benefits of deep learning-based computer-aided detection systems for finding small signals in 3D volumetric medical images
di: Klein, Devi, et al.
Pubblicazione: (2024)
di: Klein, Devi, et al.
Pubblicazione: (2024)
Open-Ended Wargames with Large Language Models
di: Hogan, Daniel P., et al.
Pubblicazione: (2024)
di: Hogan, Daniel P., et al.
Pubblicazione: (2024)
Spiking Vision Transformer with Saccadic Attention
di: Wang, Shuai, et al.
Pubblicazione: (2025)
di: Wang, Shuai, et al.
Pubblicazione: (2025)
Saccade Latency and Metrics in the Interleaved Pro‐ and Anti‐Saccade Task in Open Skill Sports Athletes
di: Jui‐Tai Chen, et al.
Pubblicazione: (2024)
di: Jui‐Tai Chen, et al.
Pubblicazione: (2024)
In Search of the Ingredients of Open-Endedness: Replicating Picbreeder with Large Vision-Language Models
di: Earle, Sam, et al.
Pubblicazione: (2026)
di: Earle, Sam, et al.
Pubblicazione: (2026)
Saccadic Vision for Fine-Grained Visual Classification
di: Schmidt, Johann, et al.
Pubblicazione: (2025)
di: Schmidt, Johann, et al.
Pubblicazione: (2025)
Goal Inference from Open-Ended Dialog
di: Ma, Rachel, et al.
Pubblicazione: (2024)
di: Ma, Rachel, et al.
Pubblicazione: (2024)
Saccade-Contingent Rendering
di: Kwak, Yuna, et al.
Pubblicazione: (2024)
di: Kwak, Yuna, et al.
Pubblicazione: (2024)
Open-Ended Goal Inference through Actions and Language for Human-Robot Collaboration
di: Ghose, Debasmita, et al.
Pubblicazione: (2025)
di: Ghose, Debasmita, et al.
Pubblicazione: (2025)
PitVQA++: Vector Matrix-Low-Rank Adaptation for Open-Ended Visual Question Answering in Pituitary Surgery
di: He, Runlong, et al.
Pubblicazione: (2025)
di: He, Runlong, et al.
Pubblicazione: (2025)
Unveiling the Potential of Vision-Language-Action Models with Open-Ended Multimodal Instructions
di: Zhao, Wei, et al.
Pubblicazione: (2025)
di: Zhao, Wei, et al.
Pubblicazione: (2025)
Too Open for Opinion? Embracing Open-Endedness in Large Language Models for Social Simulation
di: Ma, Bolei, et al.
Pubblicazione: (2025)
di: Ma, Bolei, et al.
Pubblicazione: (2025)
Benchmarking Vision, Language, & Action Models in Procedurally Generated, Open Ended Action Environments
di: Guruprasad, Pranav, et al.
Pubblicazione: (2025)
di: Guruprasad, Pranav, et al.
Pubblicazione: (2025)
Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models
di: Shi, Lucy Xiaoyang, et al.
Pubblicazione: (2025)
di: Shi, Lucy Xiaoyang, et al.
Pubblicazione: (2025)
AutoOcc: Automatic Open-Ended Semantic Occupancy Annotation via Vision-Language Guided Gaussian Splatting
di: Zhou, Xiaoyu, et al.
Pubblicazione: (2025)
di: Zhou, Xiaoyu, et al.
Pubblicazione: (2025)
AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering
di: Chen, Xiuyuan, et al.
Pubblicazione: (2023)
di: Chen, Xiuyuan, et al.
Pubblicazione: (2023)
GuessingGame: Measuring the Informativeness of Open-Ended Questions in Large Language Models
di: Hutson, Dylan, et al.
Pubblicazione: (2025)
di: Hutson, Dylan, et al.
Pubblicazione: (2025)
Embodied Scene Understanding for Vision Language Models via MetaVQA
di: Wang, Weizhen, et al.
Pubblicazione: (2025)
di: Wang, Weizhen, et al.
Pubblicazione: (2025)
Flexible Agent Alignment with Goal Inference from Open-Ended Dialog
di: Ma, Rachel, et al.
Pubblicazione: (2025)
di: Ma, Rachel, et al.
Pubblicazione: (2025)
Open-ended VQA benchmarking of Vision-Language models by exploiting Classification datasets and their semantic hierarchy
di: Ging, Simon, et al.
Pubblicazione: (2024)
di: Ging, Simon, et al.
Pubblicazione: (2024)
UniPCB: A Unified Vision-Language Benchmark for Open-Ended PCB Quality Inspection
di: Sun, Fuxiang, et al.
Pubblicazione: (2026)
di: Sun, Fuxiang, et al.
Pubblicazione: (2026)
CHIRP: A Fine-Grained Benchmark for Open-Ended Response Evaluation in Vision-Language Models
di: Roger, Alexis, et al.
Pubblicazione: (2025)
di: Roger, Alexis, et al.
Pubblicazione: (2025)
Activation-Informed Pareto-Guided Low-Rank Compression for Efficient LLM/VLM
di: Solgi, Ryan, et al.
Pubblicazione: (2025)
di: Solgi, Ryan, et al.
Pubblicazione: (2025)
On Creativity and Open-Endedness
di: Soros, L. B., et al.
Pubblicazione: (2024)
di: Soros, L. B., et al.
Pubblicazione: (2024)
Emergence of Fixational and Saccadic Movements in a Multi-Level Recurrent Attention Model for Vision
di: Pan, Pengcheng, et al.
Pubblicazione: (2025)
di: Pan, Pengcheng, et al.
Pubblicazione: (2025)
A Saccade-inspired Approach to Image Classification using Vision Transformer Attention Maps
di: Dallain, Matthis, et al.
Pubblicazione: (2026)
di: Dallain, Matthis, et al.
Pubblicazione: (2026)
Building Open-Ended Embodied Agent via Language-Policy Bidirectional Adaptation
di: Zhai, Shaopeng, et al.
Pubblicazione: (2023)
di: Zhai, Shaopeng, et al.
Pubblicazione: (2023)
Can Large Language Models Replicate ITS Feedback on Open-Ended Math Questions?
di: McNichols, Hunter, et al.
Pubblicazione: (2024)
di: McNichols, Hunter, et al.
Pubblicazione: (2024)
Towards Efficient and Robust VQA-NLE Data Generation with Large Vision-Language Models
di: Irawan, Patrick Amadeus, et al.
Pubblicazione: (2024)
di: Irawan, Patrick Amadeus, et al.
Pubblicazione: (2024)
Open-Ended Task Discovery via Bayesian Optimization
di: Adachi, Masaki, et al.
Pubblicazione: (2026)
di: Adachi, Masaki, et al.
Pubblicazione: (2026)
KOFFVQA: An Objectively Evaluated Free-form VQA Benchmark for Large Vision-Language Models in the Korean Language
di: Kim, Yoonshik, et al.
Pubblicazione: (2025)
di: Kim, Yoonshik, et al.
Pubblicazione: (2025)
Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models
di: Zhang, Zhicheng, et al.
Pubblicazione: (2025)
di: Zhang, Zhicheng, et al.
Pubblicazione: (2025)
An Overview and Discussion on Using Large Language Models for Implementation Generation of Solutions to Open-Ended Problems
di: Shaik, Hashmath, et al.
Pubblicazione: (2024)
di: Shaik, Hashmath, et al.
Pubblicazione: (2024)
VISTA: Vision-Language Inference for Training-Free Stock Time-Series Analysis
di: Khezresmaeilzadeh, Tina, et al.
Pubblicazione: (2025)
di: Khezresmaeilzadeh, Tina, et al.
Pubblicazione: (2025)
Open3D-VQA: A Benchmark for Comprehensive Spatial Reasoning with Multimodal Large Language Model in Open Space
di: Zhang, Weichen, et al.
Pubblicazione: (2025)
di: Zhang, Weichen, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Revealing the Gap in Human and VLM Scene Perception through Counterfactual Semantic Saliency
di: Wen, Ziqi, et al.
Pubblicazione: (2026) -
DReX: Pure Vision Fusion of Self-Supervised and Convolutional Representations for Image Complexity Prediction
di: Skaza, Jonathan, et al.
Pubblicazione: (2025) -
INTERLACE: Interleaved Layer Pruning and Efficient Adaptation in Large Vision-Language Models
di: Madinei, Parsa, et al.
Pubblicazione: (2025) -
ARChef: An iOS-Based Augmented Reality Cooking Assistant Powered by Multimodal Gemini LLM
di: Vir, Rithik, et al.
Pubblicazione: (2024) -
Impresiones de una exposición / Glora Gervitz
di: Gervitz, Gloria