MaViLS, a Benchmark Dataset for Video-to-Slide Alignment, Assessing Baseline Accuracy with a Multimodal Alignment Algorithm Leveraging Speech, OCR, and Visual Features
Fuente:
arXiv
Salvato in:
| Autori principali: | Anderer, Katharina, Reich, Andreas, Wölfel, Matthias |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Improving Multimodal Emotion Recognition by Leveraging Acoustic Adaptation and Visual Alignment
di: Zhao, Zhixian, et al.
Pubblicazione: (2024)
di: Zhao, Zhixian, et al.
Pubblicazione: (2024)
ViLA: Efficient Video-Language Alignment for Video Question Answering
di: Wang, Xijun, et al.
Pubblicazione: (2023)
di: Wang, Xijun, et al.
Pubblicazione: (2023)
SlideAVSR: A Dataset of Paper Explanation Videos for Audio-Visual Speech Recognition
di: Wang, Hao, et al.
Pubblicazione: (2024)
di: Wang, Hao, et al.
Pubblicazione: (2024)
MuVi: Video-to-Music Generation with Semantic Alignment and Rhythmic Synchronization
di: Li, Ruiqi, et al.
Pubblicazione: (2024)
di: Li, Ruiqi, et al.
Pubblicazione: (2024)
An Optimization Algorithm for Multimodal Data Alignment
di: Zhang, Wei, et al.
Pubblicazione: (2025)
di: Zhang, Wei, et al.
Pubblicazione: (2025)
Contextualización del reconocimiento arqueológico de Eduard Seler en la Región de Chaculá, Departamento de Huehuetenango, Guatemala
di: Wölfel, Ulrich
Pubblicazione: (2025)
di: Wölfel, Ulrich
Pubblicazione: (2025)
El jajilé azul / érsula Wölfel ; ilustraciones de Antonio Lancho
di: Wölfel, Úrsula
Pubblicazione: (1996)
di: Wölfel, Úrsula
Pubblicazione: (1996)
BioVITA: Biological Dataset, Model, and Benchmark for Visual-Textual-Acoustic Alignment
di: Shinoda, Risa, et al.
Pubblicazione: (2026)
di: Shinoda, Risa, et al.
Pubblicazione: (2026)
Evaluation of Audio-Visual Alignments in Visually Grounded Speech Models
di: Khorrami, Khazar, et al.
Pubblicazione: (2021)
di: Khorrami, Khazar, et al.
Pubblicazione: (2021)
MME-VideoOCR: Evaluating OCR-Based Capabilities of Multimodal LLMs in Video Scenarios
di: Shi, Yang, et al.
Pubblicazione: (2025)
di: Shi, Yang, et al.
Pubblicazione: (2025)
ViDSOD-100: A New Dataset and a Baseline Model for RGB-D Video Salient Object Detection
di: Lin, Junhao, et al.
Pubblicazione: (2024)
di: Lin, Junhao, et al.
Pubblicazione: (2024)
ViTaPEs: Visuotactile Position Encodings for Cross-Modal Alignment in Multimodal Transformers
di: Lygerakis, Fotios, et al.
Pubblicazione: (2025)
di: Lygerakis, Fotios, et al.
Pubblicazione: (2025)
Histoires Morales: A French Dataset for Assessing Moral Alignment
di: Leteno, Thibaud, et al.
Pubblicazione: (2025)
di: Leteno, Thibaud, et al.
Pubblicazione: (2025)
A Touch, Vision, and Language Dataset for Multimodal Alignment
di: Fu, Letian, et al.
Pubblicazione: (2024)
di: Fu, Letian, et al.
Pubblicazione: (2024)
Cultivating Pluralism In Algorithmic Monoculture: The Community Alignment Dataset
di: Zhang, Lily Hong, et al.
Pubblicazione: (2025)
di: Zhang, Lily Hong, et al.
Pubblicazione: (2025)
Learnable Chernoff Baselines for Inference-Time Alignment
di: Madhow, Sunil, et al.
Pubblicazione: (2026)
di: Madhow, Sunil, et al.
Pubblicazione: (2026)
Synthesizing Multimodal Geometry Datasets from Scratch and Enabling Visual Alignment via Plotting Code
di: Lin, Haobo, et al.
Pubblicazione: (2026)
di: Lin, Haobo, et al.
Pubblicazione: (2026)
ViMedCSS: A Vietnamese Medical Code-Switching Speech Dataset & Benchmark
di: Nguyen, Tung X., et al.
Pubblicazione: (2026)
di: Nguyen, Tung X., et al.
Pubblicazione: (2026)
MockConf: A Student Interpretation Dataset: Analysis, Word- and Span-level Alignment and Baselines
di: Javorský, Dávid, et al.
Pubblicazione: (2025)
di: Javorský, Dávid, et al.
Pubblicazione: (2025)
VidMusician: Video-to-Music Generation with Semantic-Rhythmic Alignment via Hierarchical Visual Features
di: Li, Sifei, et al.
Pubblicazione: (2024)
di: Li, Sifei, et al.
Pubblicazione: (2024)
Federated Distillation for Whole Slide Image via Gaussian-Mixture Feature Alignment and Curriculum Integration
di: Jing, Luru, et al.
Pubblicazione: (2026)
di: Jing, Luru, et al.
Pubblicazione: (2026)
ViTA-PAR: Visual and Textual Attribute Alignment with Attribute Prompting for Pedestrian Attribute Recognition
di: Park, Minjeong, et al.
Pubblicazione: (2025)
di: Park, Minjeong, et al.
Pubblicazione: (2025)
Visual Representation Alignment for Multimodal Large Language Models
di: Yoon, Heeji, et al.
Pubblicazione: (2025)
di: Yoon, Heeji, et al.
Pubblicazione: (2025)
AlignVSR: Audio-Visual Cross-Modal Alignment for Visual Speech Recognition
di: Liu, Zehua, et al.
Pubblicazione: (2024)
di: Liu, Zehua, et al.
Pubblicazione: (2024)
ViBe: A Text-to-Video Benchmark for Evaluating Hallucination in Large Multimodal Models
di: Rawte, Vipula, et al.
Pubblicazione: (2024)
di: Rawte, Vipula, et al.
Pubblicazione: (2024)
LiFT: Leveraging Human Feedback for Text-to-Video Model Alignment
di: Wang, Yibin, et al.
Pubblicazione: (2024)
di: Wang, Yibin, et al.
Pubblicazione: (2024)
VITAL: A New Dataset for Benchmarking Pluralistic Alignment in Healthcare
di: Shetty, Anudeex, et al.
Pubblicazione: (2025)
di: Shetty, Anudeex, et al.
Pubblicazione: (2025)
A Cross-Cultural Assessment of Human Ability to Detect LLM-Generated Fake News about South Africa
di: Schlippe, Tim, et al.
Pubblicazione: (2025)
di: Schlippe, Tim, et al.
Pubblicazione: (2025)
Large Language Models for Sentiment Analysis to Detect Social Challenges: A Use Case with South African Languages
di: Mabokela, Koena Ronny, et al.
Pubblicazione: (2025)
di: Mabokela, Koena Ronny, et al.
Pubblicazione: (2025)
Adversarial Feature Alignment: Balancing Robustness and Accuracy in Deep Learning via Adversarial Training
di: Park, Leo Hyun, et al.
Pubblicazione: (2024)
di: Park, Leo Hyun, et al.
Pubblicazione: (2024)
CC-OCR: A Comprehensive and Challenging OCR Benchmark for Evaluating Large Multimodal Models in Literacy
di: Yang, Zhibo, et al.
Pubblicazione: (2024)
di: Yang, Zhibo, et al.
Pubblicazione: (2024)
SpeechAlign: a Framework for Speech Translation Alignment Evaluation
di: Alastruey, Belen, et al.
Pubblicazione: (2023)
di: Alastruey, Belen, et al.
Pubblicazione: (2023)
HuViDPO:Enhancing Video Generation through Direct Preference Optimization for Human-Centric Alignment
di: Jiang, Lifan, et al.
Pubblicazione: (2025)
di: Jiang, Lifan, et al.
Pubblicazione: (2025)
ViP$^2$-CLIP: Visual-Perception Prompting with Unified Alignment for Zero-Shot Anomaly Detection
di: Yang, Ziteng, et al.
Pubblicazione: (2025)
di: Yang, Ziteng, et al.
Pubblicazione: (2025)
Towards Unified Multimodal Misinformation Detection in Social Media: A Benchmark Dataset and Baseline
di: Li, Haiyang, et al.
Pubblicazione: (2025)
di: Li, Haiyang, et al.
Pubblicazione: (2025)
Latent Denoising Improves Visual Alignment in Large Multimodal Models
di: Parikh, Dhruv, et al.
Pubblicazione: (2026)
di: Parikh, Dhruv, et al.
Pubblicazione: (2026)
LVRPO: Language-Visual Alignment with GRPO for Multimodal Understanding and Generation
di: Mo, Shentong, et al.
Pubblicazione: (2026)
di: Mo, Shentong, et al.
Pubblicazione: (2026)
Prototype-Aware Multimodal Alignment for Open-Vocabulary Visual Grounding
di: Xie, Jiangnan, et al.
Pubblicazione: (2025)
di: Xie, Jiangnan, et al.
Pubblicazione: (2025)
Parameter-interval estimation for cooperative reactive sputtering processes
di: Schneider, Fabian, et al.
Pubblicazione: (2026)
di: Schneider, Fabian, et al.
Pubblicazione: (2026)
Towards Video Anomaly Detection from Event Streams: A Baseline and Benchmark Datasets
di: Wu, Peng, et al.
Pubblicazione: (2026)
di: Wu, Peng, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Improving Multimodal Emotion Recognition by Leveraging Acoustic Adaptation and Visual Alignment
di: Zhao, Zhixian, et al.
Pubblicazione: (2024) -
ViLA: Efficient Video-Language Alignment for Video Question Answering
di: Wang, Xijun, et al.
Pubblicazione: (2023) -
SlideAVSR: A Dataset of Paper Explanation Videos for Audio-Visual Speech Recognition
di: Wang, Hao, et al.
Pubblicazione: (2024) -
MuVi: Video-to-Music Generation with Semantic Alignment and Rhythmic Synchronization
di: Li, Ruiqi, et al.
Pubblicazione: (2024) -
An Optimization Algorithm for Multimodal Data Alignment
di: Zhang, Wei, et al.
Pubblicazione: (2025)