AI-based System for Transforming text and sound to Educational Videos
Fuente:
arXiv
Salvato in:
| Autori principali: | ElAlami, M. E., Khater, S. M., Rehan, M. El. R. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Can LLMs Create Legally Relevant Summaries and Analyses of Videos?
di: Hoeben-Kuil, Lyra, et al.
Pubblicazione: (2025)
di: Hoeben-Kuil, Lyra, et al.
Pubblicazione: (2025)
Harmful YouTube Video Detection: A Taxonomy of Online Harm and MLLMs as Alternative Annotators
di: Jo, Claire Wonjeong, et al.
Pubblicazione: (2024)
di: Jo, Claire Wonjeong, et al.
Pubblicazione: (2024)
ObjFormer: Learning Land-Cover Changes From Paired OSM Data and Optical High-Resolution Imagery via Object-Guided Transformer
di: Chen, Hongruixuan, et al.
Pubblicazione: (2023)
di: Chen, Hongruixuan, et al.
Pubblicazione: (2023)
KI-Bilder und die Widerständigkeit der Medienkonvergenz: Von primärer zu sekundärer Intermedialität?
di: Wilde, Lukas R. A.
Pubblicazione: (2024)
di: Wilde, Lukas R. A.
Pubblicazione: (2024)
TraceRouter: Robust Safety for Large Foundation Models via Path-Level Intervention
di: Shi, Chuancheng, et al.
Pubblicazione: (2026)
di: Shi, Chuancheng, et al.
Pubblicazione: (2026)
Towards nation-wide analytical healthcare infrastructures: A privacy-preserving augmented knee rehabilitation case study
di: Bačić, Boris, et al.
Pubblicazione: (2024)
di: Bačić, Boris, et al.
Pubblicazione: (2024)
Advance Fake Video Detection via Vision Transformers
di: Battocchio, Joy, et al.
Pubblicazione: (2025)
di: Battocchio, Joy, et al.
Pubblicazione: (2025)
Moiré Video Authentication: A Physical Signature Against AI Video Generation
di: Qing, Yuan, et al.
Pubblicazione: (2026)
di: Qing, Yuan, et al.
Pubblicazione: (2026)
Robust Latent Representation Tuning for Image-text Classification
di: Sun, Hao, et al.
Pubblicazione: (2024)
di: Sun, Hao, et al.
Pubblicazione: (2024)
A Survey on Generative AI and LLM for Video Generation, Understanding, and Streaming
di: Zhou, Pengyuan, et al.
Pubblicazione: (2024)
di: Zhou, Pengyuan, et al.
Pubblicazione: (2024)
LPM 1.0: Video-based Character Performance Model
di: Zeng, Ailing, et al.
Pubblicazione: (2026)
di: Zeng, Ailing, et al.
Pubblicazione: (2026)
AesopAgent: Agent-driven Evolutionary System on Story-to-Video Production
di: Wang, Jiuniu, et al.
Pubblicazione: (2024)
di: Wang, Jiuniu, et al.
Pubblicazione: (2024)
DiTCtrl: Exploring Attention Control in Multi-Modal Diffusion Transformer for Tuning-Free Multi-Prompt Longer Video Generation
di: Cai, Minghong, et al.
Pubblicazione: (2024)
di: Cai, Minghong, et al.
Pubblicazione: (2024)
SNIFFER: Multimodal Large Language Model for Explainable Out-of-Context Misinformation Detection
di: Qi, Peng, et al.
Pubblicazione: (2024)
di: Qi, Peng, et al.
Pubblicazione: (2024)
MORALISE: A Structured Benchmark for Moral Alignment in Visual Language Models
di: Lin, Xiao, et al.
Pubblicazione: (2025)
di: Lin, Xiao, et al.
Pubblicazione: (2025)
AI-Driven Virtual Teacher for Enhanced Educational Efficiency: Leveraging Large Pretrain Models for Autonomous Error Analysis and Correction
di: Xu, Tianlong, et al.
Pubblicazione: (2024)
di: Xu, Tianlong, et al.
Pubblicazione: (2024)
Video Seal: Open and Efficient Video Watermarking
di: Fernandez, Pierre, et al.
Pubblicazione: (2024)
di: Fernandez, Pierre, et al.
Pubblicazione: (2024)
FedVideoMAE: Efficient Privacy-Preserving Federated Video Moderation
di: Tao, Ziyuan, et al.
Pubblicazione: (2025)
di: Tao, Ziyuan, et al.
Pubblicazione: (2025)
VIA: Unified Spatiotemporal Video Adaptation Framework for Global and Local Video Editing
di: Gu, Jing, et al.
Pubblicazione: (2024)
di: Gu, Jing, et al.
Pubblicazione: (2024)
Video-EM: Event-Centric Episodic Memory for Long-Form Video Understanding
di: Wang, Yun, et al.
Pubblicazione: (2025)
di: Wang, Yun, et al.
Pubblicazione: (2025)
Open-o3-Video: Grounded Video Reasoning with Explicit Spatio-Temporal Evidence
di: Meng, Jiahao, et al.
Pubblicazione: (2025)
di: Meng, Jiahao, et al.
Pubblicazione: (2025)
VideoPainter: Any-length Video Inpainting and Editing with Plug-and-Play Context Control
di: Bian, Yuxuan, et al.
Pubblicazione: (2025)
di: Bian, Yuxuan, et al.
Pubblicazione: (2025)
Kangaroo: A Powerful Video-Language Model Supporting Long-context Video Input
di: Liu, Jiajun, et al.
Pubblicazione: (2024)
di: Liu, Jiajun, et al.
Pubblicazione: (2024)
Long Video Diffusion Generation with Segmented Cross-Attention and Content-Rich Video Data Curation
di: Yan, Xin, et al.
Pubblicazione: (2024)
di: Yan, Xin, et al.
Pubblicazione: (2024)
AnyV2V: A Tuning-Free Framework For Any Video-to-Video Editing Tasks
di: Ku, Max, et al.
Pubblicazione: (2024)
di: Ku, Max, et al.
Pubblicazione: (2024)
DIBS: Enhancing Dense Video Captioning with Unlabeled Videos via Pseudo Boundary Enrichment and Online Refinement
di: Wu, Hao, et al.
Pubblicazione: (2024)
di: Wu, Hao, et al.
Pubblicazione: (2024)
Question-Answering Dense Video Events
di: Qin, Hangyu, et al.
Pubblicazione: (2024)
di: Qin, Hangyu, et al.
Pubblicazione: (2024)
Bernini: Latent Semantic Planning for Video Diffusion
di: Bernini Team, et al.
Pubblicazione: (2026)
di: Bernini Team, et al.
Pubblicazione: (2026)
Interactive Video Generation via Domain Adaptation
di: Rawal, Ishaan, et al.
Pubblicazione: (2025)
di: Rawal, Ishaan, et al.
Pubblicazione: (2025)
Embedding an Ethical Mind: Aligning Text-to-Image Synthesis via Lightweight Value Optimization
di: Wang, Xingqi, et al.
Pubblicazione: (2024)
di: Wang, Xingqi, et al.
Pubblicazione: (2024)
Unmasking Illusions: Understanding Human Perception of Audiovisual Deepfakes
di: Hashmi, Ammarah, et al.
Pubblicazione: (2024)
di: Hashmi, Ammarah, et al.
Pubblicazione: (2024)
Image Conductor: Precision Control for Interactive Video Synthesis
di: Li, Yaowei, et al.
Pubblicazione: (2024)
di: Li, Yaowei, et al.
Pubblicazione: (2024)
Multimodal Chaptering for Long-Form TV Newscast Video
di: Guetari, Khalil, et al.
Pubblicazione: (2024)
di: Guetari, Khalil, et al.
Pubblicazione: (2024)
Unsupervised Transcript-assisted Video Summarization and Highlight Detection
di: Barbakos, Spyros, et al.
Pubblicazione: (2025)
di: Barbakos, Spyros, et al.
Pubblicazione: (2025)
Label-anticipated Event Disentanglement for Audio-Visual Video Parsing
di: Zhou, Jinxing, et al.
Pubblicazione: (2024)
di: Zhou, Jinxing, et al.
Pubblicazione: (2024)
Audio-visual Event Localization on Portrait Mode Short Videos
di: Liu, Wuyang, et al.
Pubblicazione: (2025)
di: Liu, Wuyang, et al.
Pubblicazione: (2025)
TheoremExplainAgent: Towards Video-based Multimodal Explanations for LLM Theorem Understanding
di: Ku, Max, et al.
Pubblicazione: (2025)
di: Ku, Max, et al.
Pubblicazione: (2025)
EgoEsportsQA: An Egocentric Video Benchmark for Perception and Reasoning in Esports
di: Ma, Jianzhe, et al.
Pubblicazione: (2026)
di: Ma, Jianzhe, et al.
Pubblicazione: (2026)
LoViF 2026 The First Challenge on Weather Removal in Videos
di: Qian, Chenghao, et al.
Pubblicazione: (2026)
di: Qian, Chenghao, et al.
Pubblicazione: (2026)
UniVid: Pyramid Diffusion Model for High Quality Video Generation
di: Xiao, Xinyu, et al.
Pubblicazione: (2026)
di: Xiao, Xinyu, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Can LLMs Create Legally Relevant Summaries and Analyses of Videos?
di: Hoeben-Kuil, Lyra, et al.
Pubblicazione: (2025) -
Harmful YouTube Video Detection: A Taxonomy of Online Harm and MLLMs as Alternative Annotators
di: Jo, Claire Wonjeong, et al.
Pubblicazione: (2024) -
ObjFormer: Learning Land-Cover Changes From Paired OSM Data and Optical High-Resolution Imagery via Object-Guided Transformer
di: Chen, Hongruixuan, et al.
Pubblicazione: (2023) -
KI-Bilder und die Widerständigkeit der Medienkonvergenz: Von primärer zu sekundärer Intermedialität?
di: Wilde, Lukas R. A.
Pubblicazione: (2024) -
TraceRouter: Robust Safety for Large Foundation Models via Path-Level Intervention
di: Shi, Chuancheng, et al.
Pubblicazione: (2026)