Evaluation of Audio-Visual Alignments in Visually Grounded Speech Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Khorrami, Khazar, Räsänen, Okko |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2021
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Can phones, syllables, and words emerge as side-products of cross-situational audiovisual learning? -- A computational investigation
di: Khorrami, Khazar, et al.
Pubblicazione: (2021)
di: Khorrami, Khazar, et al.
Pubblicazione: (2021)
A model of early word acquisition based on realistic-scale audiovisual naming events
di: Khorrami, Khazar, et al.
Pubblicazione: (2024)
di: Khorrami, Khazar, et al.
Pubblicazione: (2024)
EMMA: Efficient Visual Alignment in Multi-Modal LLMs
di: Ghazanfari, Sara, et al.
Pubblicazione: (2024)
di: Ghazanfari, Sara, et al.
Pubblicazione: (2024)
Learning from Synthetic Data for Visual Grounding
di: He, Ruozhen, et al.
Pubblicazione: (2024)
di: He, Ruozhen, et al.
Pubblicazione: (2024)
Composition-Grounded Data Synthesis for Visual Reasoning
di: Gu, Xinyi, et al.
Pubblicazione: (2025)
di: Gu, Xinyi, et al.
Pubblicazione: (2025)
Towards Grounded Visual Spatial Reasoning in Multi-Modal Vision Language Models
di: Rajabi, Navid, et al.
Pubblicazione: (2023)
di: Rajabi, Navid, et al.
Pubblicazione: (2023)
Multi-Modal Hallucination Control by Visual Information Grounding
di: Favero, Alessandro, et al.
Pubblicazione: (2024)
di: Favero, Alessandro, et al.
Pubblicazione: (2024)
The ART of Composition: Attention-Regularized Training for Compositional Visual Grounding
di: Luo, Jiayun, et al.
Pubblicazione: (2024)
di: Luo, Jiayun, et al.
Pubblicazione: (2024)
Improving Visual Grounding by Encouraging Consistent Gradient-based Explanations
di: Yang, Ziyan, et al.
Pubblicazione: (2022)
di: Yang, Ziyan, et al.
Pubblicazione: (2022)
VisualWebArena: Evaluating Multimodal Agents on Realistic Visual Web Tasks
di: Koh, Jing Yu, et al.
Pubblicazione: (2024)
di: Koh, Jing Yu, et al.
Pubblicazione: (2024)
A Survey of Automatic Evaluation Methods on Text, Visual and Speech Generations
di: Lan, Tian, et al.
Pubblicazione: (2025)
di: Lan, Tian, et al.
Pubblicazione: (2025)
OLKAVS: An Open Large-Scale Korean Audio-Visual Speech Dataset
di: Park, Jeongkyun, et al.
Pubblicazione: (2023)
di: Park, Jeongkyun, et al.
Pubblicazione: (2023)
VisualRWKV: Exploring Recurrent Neural Networks for Visual Language Models
di: Hou, Haowen, et al.
Pubblicazione: (2024)
di: Hou, Haowen, et al.
Pubblicazione: (2024)
Why are Visually-Grounded Language Models Bad at Image Classification?
di: Zhang, Yuhui, et al.
Pubblicazione: (2024)
di: Zhang, Yuhui, et al.
Pubblicazione: (2024)
Towards Visual Text Grounding of Multimodal Large Language Model
di: Li, Ming, et al.
Pubblicazione: (2025)
di: Li, Ming, et al.
Pubblicazione: (2025)
Seeing Through Their Eyes: Evaluating Visual Perspective Taking in Vision Language Models
di: Góral, Gracjan, et al.
Pubblicazione: (2024)
di: Góral, Gracjan, et al.
Pubblicazione: (2024)
Lightweight Operations for Visual Speech Recognition
di: Panagos, Iason Ioannis, et al.
Pubblicazione: (2025)
di: Panagos, Iason Ioannis, et al.
Pubblicazione: (2025)
Self-Supervised Visual Preference Alignment
di: Zhu, Ke, et al.
Pubblicazione: (2024)
di: Zhu, Ke, et al.
Pubblicazione: (2024)
Progressive Multi-granular Alignments for Grounded Reasoning in Large Vision-Language Models
di: Le, Quang-Hung, et al.
Pubblicazione: (2024)
di: Le, Quang-Hung, et al.
Pubblicazione: (2024)
Rephrase, Augment, Reason: Visual Grounding of Questions for Vision-Language Models
di: Prasad, Archiki, et al.
Pubblicazione: (2023)
di: Prasad, Archiki, et al.
Pubblicazione: (2023)
Groma: Localized Visual Tokenization for Grounding Multimodal Large Language Models
di: Ma, Chuofan, et al.
Pubblicazione: (2024)
di: Ma, Chuofan, et al.
Pubblicazione: (2024)
MM-Instruct: Generated Visual Instructions for Large Multimodal Model Alignment
di: Liu, Jihao, et al.
Pubblicazione: (2024)
di: Liu, Jihao, et al.
Pubblicazione: (2024)
Mostly Text, Smart Visuals: Asymmetric Text-Visual Pruning for Large Vision-Language Models
di: Li, Sijie, et al.
Pubblicazione: (2026)
di: Li, Sijie, et al.
Pubblicazione: (2026)
Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering
di: Lagos, Maximiliano Hormazábal, et al.
Pubblicazione: (2025)
di: Lagos, Maximiliano Hormazábal, et al.
Pubblicazione: (2025)
Cross-modal Causal Relation Alignment for Video Question Grounding
di: Chen, Weixing, et al.
Pubblicazione: (2025)
di: Chen, Weixing, et al.
Pubblicazione: (2025)
Unified Lexical Representation for Interpretable Visual-Language Alignment
di: Li, Yifan, et al.
Pubblicazione: (2024)
di: Li, Yifan, et al.
Pubblicazione: (2024)
Not (yet) the whole story: Evaluating Visual Storytelling Requires More than Measuring Coherence, Grounding, and Repetition
di: Surikuchi, Aditya K, et al.
Pubblicazione: (2024)
di: Surikuchi, Aditya K, et al.
Pubblicazione: (2024)
ExpVG: Investigating the Design Space of Visual Grounding in Multimodal Large Language Model
di: Kang, Weitai, et al.
Pubblicazione: (2025)
di: Kang, Weitai, et al.
Pubblicazione: (2025)
CAPability: A Comprehensive Visual Caption Benchmark for Evaluating Both Correctness and Thoroughness
di: Liu, Zhihang, et al.
Pubblicazione: (2025)
di: Liu, Zhihang, et al.
Pubblicazione: (2025)
LLMs as Visual Explainers: Advancing Image Classification with Evolving Visual Descriptions
di: Han, Songhao, et al.
Pubblicazione: (2023)
di: Han, Songhao, et al.
Pubblicazione: (2023)
Unifying Specialized Visual Encoders for Video Language Models
di: Chung, Jihoon, et al.
Pubblicazione: (2025)
di: Chung, Jihoon, et al.
Pubblicazione: (2025)
Multi-modal Preference Alignment Remedies Degradation of Visual Instruction Tuning on Language Models
di: Li, Shengzhi, et al.
Pubblicazione: (2024)
di: Li, Shengzhi, et al.
Pubblicazione: (2024)
FlagEval Findings Report: A Preliminary Evaluation of Large Reasoning Models on Automatically Verifiable Textual and Visual Questions
di: Qin, Bowen, et al.
Pubblicazione: (2025)
di: Qin, Bowen, et al.
Pubblicazione: (2025)
By My Eyes: Grounding Multimodal Large Language Models with Sensor Data via Visual Prompting
di: Yoon, Hyungjun, et al.
Pubblicazione: (2024)
di: Yoon, Hyungjun, et al.
Pubblicazione: (2024)
Tailored Design of Audio-Visual Speech Recognition Models using Branchformers
di: Gimeno-Gómez, David, et al.
Pubblicazione: (2024)
di: Gimeno-Gómez, David, et al.
Pubblicazione: (2024)
Visually Grounded Speech Models for Low-resource Languages and Cognitive Modelling
di: Nortje, Leanne
Pubblicazione: (2024)
di: Nortje, Leanne
Pubblicazione: (2024)
Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-Improvement
di: Wang, Xiyao, et al.
Pubblicazione: (2024)
di: Wang, Xiyao, et al.
Pubblicazione: (2024)
Dr-LLaVA: Visual Instruction Tuning with Symbolic Clinical Grounding
di: Sun, Shenghuan, et al.
Pubblicazione: (2024)
di: Sun, Shenghuan, et al.
Pubblicazione: (2024)
Weakly-Supervised 3D Visual Grounding based on Visual Language Alignment
di: Xu, Xiaoxu, et al.
Pubblicazione: (2023)
di: Xu, Xiaoxu, et al.
Pubblicazione: (2023)
MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts
di: Lu, Pan, et al.
Pubblicazione: (2023)
di: Lu, Pan, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Can phones, syllables, and words emerge as side-products of cross-situational audiovisual learning? -- A computational investigation
di: Khorrami, Khazar, et al.
Pubblicazione: (2021) -
A model of early word acquisition based on realistic-scale audiovisual naming events
di: Khorrami, Khazar, et al.
Pubblicazione: (2024) -
EMMA: Efficient Visual Alignment in Multi-Modal LLMs
di: Ghazanfari, Sara, et al.
Pubblicazione: (2024) -
Learning from Synthetic Data for Visual Grounding
di: He, Ruozhen, et al.
Pubblicazione: (2024) -
Composition-Grounded Data Synthesis for Visual Reasoning
di: Gu, Xinyi, et al.
Pubblicazione: (2025)