Enhancing the Learning Experience: Using Vision-Language Models to Generate Questions for Educational Videos
Fuente:
arXiv
Guardado en:
| Autores principales: | Stamatakis, Markos, Berger, Joshua, Wartena, Christian, Ewerth, Ralph, Hoppe, Anett |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Saliency Detection in Educational Videos: Analyzing the Performance of Current Models, Identifying Limitations and Advancement Directions
por: Navarrete, Evelyn, et al.
Publicado: (2024)
por: Navarrete, Evelyn, et al.
Publicado: (2024)
Multimodal Misinformation Detection using Large Vision-Language Models
por: Tahmasebi, Sahar, et al.
Publicado: (2024)
por: Tahmasebi, Sahar, et al.
Publicado: (2024)
COM Kitchens: An Unedited Overhead-view Video Dataset as a Vision-Language Benchmark
por: Maeda, Koki, et al.
Publicado: (2024)
por: Maeda, Koki, et al.
Publicado: (2024)
Ask Questions with Double Hints: Visual Question Generation with Answer-awareness and Region-reference
por: Shen, Kai, et al.
Publicado: (2024)
por: Shen, Kai, et al.
Publicado: (2024)
LocoMotion: Learning Motion-Focused Video-Language Representations
por: Doughty, Hazel, et al.
Publicado: (2024)
por: Doughty, Hazel, et al.
Publicado: (2024)
BioVL-QR: Egocentric Biochemical Vision-and-Language Dataset Using Micro QR Codes
por: Nishimoto, Tomohiro, et al.
Publicado: (2024)
por: Nishimoto, Tomohiro, et al.
Publicado: (2024)
POLYCHARTQA: Benchmarking Large Vision-Language Models with Multilingual Chart Question Answering
por: Xu, Yichen, et al.
Publicado: (2025)
por: Xu, Yichen, et al.
Publicado: (2025)
Knowledge Acquisition Disentanglement for Knowledge-based Visual Question Answering with Large Language Models
por: An, Wenbin, et al.
Publicado: (2024)
por: An, Wenbin, et al.
Publicado: (2024)
Verifying Cross-modal Entity Consistency in News using Vision-language Models
por: Tahmasebi, Sahar, et al.
Publicado: (2025)
por: Tahmasebi, Sahar, et al.
Publicado: (2025)
Recipe Generation from Unsegmented Cooking Videos
por: Nishimura, Taichi, et al.
Publicado: (2022)
por: Nishimura, Taichi, et al.
Publicado: (2022)
RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language
por: Biswas, Subrata, et al.
Publicado: (2025)
por: Biswas, Subrata, et al.
Publicado: (2025)
Mitigating Hallucination in Large Vision-Language Models via Adaptive Attention Calibration
por: Fazli, Mehrdad, et al.
Publicado: (2025)
por: Fazli, Mehrdad, et al.
Publicado: (2025)
Bi-VLDoc: Bidirectional Vision-Language Modeling for Visually-Rich Document Understanding
por: Luo, Chuwei, et al.
Publicado: (2022)
por: Luo, Chuwei, et al.
Publicado: (2022)
MLANet: Multi-Level Attention Network with Sub-instruction for Continuous Vision-and-Language Navigation
por: He, Zongtao, et al.
Publicado: (2023)
por: He, Zongtao, et al.
Publicado: (2023)
Recurrence-Enhanced Vision-and-Language Transformers for Robust Multimodal Document Retrieval
por: Caffagni, Davide, et al.
Publicado: (2025)
por: Caffagni, Davide, et al.
Publicado: (2025)
Seeing Through Deception: Uncovering Misleading Creator Intent in Multimodal News with Vision-Language Models
por: Wu, Jiaying, et al.
Publicado: (2025)
por: Wu, Jiaying, et al.
Publicado: (2025)
Factorized Learning for Temporally Grounded Video-Language Models
por: Zeng, Wenzheng, et al.
Publicado: (2025)
por: Zeng, Wenzheng, et al.
Publicado: (2025)
CounterVid: Counterfactual Video Generation for Mitigating Action and Temporal Hallucinations in Video-Language Models
por: Poppi, Tobia, et al.
Publicado: (2026)
por: Poppi, Tobia, et al.
Publicado: (2026)
EasyAnimate: High-Performance Video Generation Framework with Hybrid Windows Attention and Reward Backpropagation
por: Xu, Jiaqi, et al.
Publicado: (2024)
por: Xu, Jiaqi, et al.
Publicado: (2024)
Anim-Director: A Large Multimodal Model Powered Agent for Controllable Animation Video Generation
por: Li, Yunxin, et al.
Publicado: (2024)
por: Li, Yunxin, et al.
Publicado: (2024)
Self-Adaptive Sampling for Efficient Video Question-Answering on Image--Text Models
por: Han, Wei, et al.
Publicado: (2023)
por: Han, Wei, et al.
Publicado: (2023)
Positive-Augmented Contrastive Learning for Vision-and-Language Evaluation and Training
por: Sarto, Sara, et al.
Publicado: (2024)
por: Sarto, Sara, et al.
Publicado: (2024)
MuLTI: Efficient Video-and-Language Understanding with Text-Guided MultiWay-Sampler and Multiple Choice Modeling
por: Xu, Jiaqi, et al.
Publicado: (2023)
por: Xu, Jiaqi, et al.
Publicado: (2023)
KeyVideoLLM: Towards Large-scale Video Keyframe Selection
por: Liang, Hao, et al.
Publicado: (2024)
por: Liang, Hao, et al.
Publicado: (2024)
FastPerson: Enhancing Video Learning through Effective Video Summarization that Preserves Linguistic and Visual Contexts
por: Kawamura, Kazuki, et al.
Publicado: (2024)
por: Kawamura, Kazuki, et al.
Publicado: (2024)
VideoCLIP-XL: Advancing Long Description Understanding for Video CLIP Models
por: Wang, Jiapeng, et al.
Publicado: (2024)
por: Wang, Jiapeng, et al.
Publicado: (2024)
LongVALE: Vision-Audio-Language-Event Benchmark Towards Time-Aware Omni-Modal Perception of Long Videos
por: Geng, Tiantian, et al.
Publicado: (2024)
por: Geng, Tiantian, et al.
Publicado: (2024)
Prompt-A-Video: Prompt Your Video Diffusion Model via Preference-Aligned LLM
por: Ji, Yatai, et al.
Publicado: (2024)
por: Ji, Yatai, et al.
Publicado: (2024)
Video2Roleplay: A Multimodal Dataset and Framework for Video-Guided Role-playing Agents
por: Zhang, Xueqiao, et al.
Publicado: (2025)
por: Zhang, Xueqiao, et al.
Publicado: (2025)
Co-Reinforcement Learning for Unified Multimodal Understanding and Generation
por: Jiang, Jingjing, et al.
Publicado: (2025)
por: Jiang, Jingjing, et al.
Publicado: (2025)
Multi-task Prompt Words Learning for Social Media Content Generation
por: Xue, Haochen, et al.
Publicado: (2024)
por: Xue, Haochen, et al.
Publicado: (2024)
Dual-Modal Attention-Enhanced Text-Video Retrieval with Triplet Partial Margin Contrastive Learning
por: Jiang, Chen, et al.
Publicado: (2023)
por: Jiang, Chen, et al.
Publicado: (2023)
Towards Event-oriented Long Video Understanding
por: Du, Yifan, et al.
Publicado: (2024)
por: Du, Yifan, et al.
Publicado: (2024)
HAIC: Improving Human Action Understanding and Generation with Better Captions for Multi-modal Large Language Models
por: Wang, Xiao, et al.
Publicado: (2025)
por: Wang, Xiao, et al.
Publicado: (2025)
Beyond Coarse-Grained Matching in Video-Text Retrieval
por: Chen, Aozhu, et al.
Publicado: (2024)
por: Chen, Aozhu, et al.
Publicado: (2024)
Language Models as Black-Box Optimizers for Vision-Language Models
por: Liu, Shihong, et al.
Publicado: (2023)
por: Liu, Shihong, et al.
Publicado: (2023)
ReAG: Reasoning-Augmented Generation for Knowledge-based Visual Question Answering
por: Compagnoni, Alberto, et al.
Publicado: (2025)
por: Compagnoni, Alberto, et al.
Publicado: (2025)
Code2Video: A Code-centric Paradigm for Educational Video Generation
por: Chen, Yanzhe, et al.
Publicado: (2025)
por: Chen, Yanzhe, et al.
Publicado: (2025)
Video DataFlywheel: Resolving the Impossible Data Trinity in Video-Language Understanding
por: Wang, Xiao, et al.
Publicado: (2024)
por: Wang, Xiao, et al.
Publicado: (2024)
Hyperbolic Safety-Aware Vision-Language Models
por: Poppi, Tobia, et al.
Publicado: (2025)
por: Poppi, Tobia, et al.
Publicado: (2025)
Ejemplares similares
-
Saliency Detection in Educational Videos: Analyzing the Performance of Current Models, Identifying Limitations and Advancement Directions
por: Navarrete, Evelyn, et al.
Publicado: (2024) -
Multimodal Misinformation Detection using Large Vision-Language Models
por: Tahmasebi, Sahar, et al.
Publicado: (2024) -
COM Kitchens: An Unedited Overhead-view Video Dataset as a Vision-Language Benchmark
por: Maeda, Koki, et al.
Publicado: (2024) -
Ask Questions with Double Hints: Visual Question Generation with Answer-awareness and Region-reference
por: Shen, Kai, et al.
Publicado: (2024) -
LocoMotion: Learning Motion-Focused Video-Language Representations
por: Doughty, Hazel, et al.
Publicado: (2024)