Paper2Video: Automatic Video Generation from Scientific Papers
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhu, Zeyu, Lin, Kevin Qinghong, Shou, Mike Zheng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Paper2Poster: Towards Multimodal Poster Automation from Scientific Papers
por: Pang, Wei, et al.
Publicado: (2025)
por: Pang, Wei, et al.
Publicado: (2025)
Code2Video: A Code-centric Paradigm for Educational Video Generation
por: Chen, Yanzhe, et al.
Publicado: (2025)
por: Chen, Yanzhe, et al.
Publicado: (2025)
Factorized Learning for Temporally Grounded Video-Language Models
por: Zeng, Wenzheng, et al.
Publicado: (2025)
por: Zeng, Wenzheng, et al.
Publicado: (2025)
SEAgent: Self-Evolving Computer Use Agent with Autonomous Learning from Experience
por: Sun, Zeyi, et al.
Publicado: (2025)
por: Sun, Zeyi, et al.
Publicado: (2025)
Don't Guess, Escalate: Towards Explainable Uncertainty-Calibrated AI Forensic Agents
por: Boato, Giulia, et al.
Publicado: (2025)
por: Boato, Giulia, et al.
Publicado: (2025)
LVRPO: Language-Visual Alignment with GRPO for Multimodal Understanding and Generation
por: Mo, Shentong, et al.
Publicado: (2026)
por: Mo, Shentong, et al.
Publicado: (2026)
PreMind: Multi-Agent Video Understanding for Advanced Indexing of Presentation-style Videos
por: Wei, Kangda, et al.
Publicado: (2025)
por: Wei, Kangda, et al.
Publicado: (2025)
Agentic Design Review System
por: Nag, Sayan, et al.
Publicado: (2025)
por: Nag, Sayan, et al.
Publicado: (2025)
Multi-agent Undercover Gaming: Hallucination Removal via Counterfactual Test for Multimodal Reasoning
por: Liang, Dayong, et al.
Publicado: (2025)
por: Liang, Dayong, et al.
Publicado: (2025)
A Picture Is Worth a Graph: A Blueprint Debate Paradigm for Multimodal Reasoning
por: Zheng, Changmeng, et al.
Publicado: (2024)
por: Zheng, Changmeng, et al.
Publicado: (2024)
CounterVid: Counterfactual Video Generation for Mitigating Action and Temporal Hallucinations in Video-Language Models
por: Poppi, Tobia, et al.
Publicado: (2026)
por: Poppi, Tobia, et al.
Publicado: (2026)
Video Summarization: Towards Entity-Aware Captions
por: Ayyubi, Hammad A., et al.
Publicado: (2023)
por: Ayyubi, Hammad A., et al.
Publicado: (2023)
Enhancing Agentic Autonomous Scientific Discovery with Vision-Language Model Capabilities
por: Gandhi, Kahaan, et al.
Publicado: (2025)
por: Gandhi, Kahaan, et al.
Publicado: (2025)
Learning Video Context as Interleaved Multimodal Sequences
por: Lin, Kevin Qinghong, et al.
Publicado: (2024)
por: Lin, Kevin Qinghong, et al.
Publicado: (2024)
Multi-Agent System for AI-Assisted Extraction of Narrative Arcs in TV Series
por: Balestri, Roberto, et al.
Publicado: (2025)
por: Balestri, Roberto, et al.
Publicado: (2025)
VideoAutoArena: An Automated Arena for Evaluating Large Multimodal Models in Video Analysis through User Simulation
por: Luo, Ziyang, et al.
Publicado: (2024)
por: Luo, Ziyang, et al.
Publicado: (2024)
FunQA: Towards Surprising Video Comprehension
por: Xie, Binzhu, et al.
Publicado: (2023)
por: Xie, Binzhu, et al.
Publicado: (2023)
Many Heads Are Better Than One: Improved Scientific Idea Generation by A LLM-Based Multi-Agent System
por: Su, Haoyang, et al.
Publicado: (2024)
por: Su, Haoyang, et al.
Publicado: (2024)
StoryAgent: Customized Storytelling Video Generation via Multi-Agent Collaboration
por: Hu, Panwen, et al.
Publicado: (2024)
por: Hu, Panwen, et al.
Publicado: (2024)
Co-Director: Agentic Generative Video Storytelling
por: Song, Yale, et al.
Publicado: (2026)
por: Song, Yale, et al.
Publicado: (2026)
TTOM: Test-Time Optimization and Memorization for Compositional Video Generation
por: Qu, Leigang, et al.
Publicado: (2025)
por: Qu, Leigang, et al.
Publicado: (2025)
TimeLens: Rethinking Video Temporal Grounding with Multimodal LLMs
por: Zhang, Jun, et al.
Publicado: (2025)
por: Zhang, Jun, et al.
Publicado: (2025)
Transductive Visual Programming: Evolving Tool Libraries from Experience for Spatial Reasoning
por: Wu, Shengguang, et al.
Publicado: (2025)
por: Wu, Shengguang, et al.
Publicado: (2025)
Moiré Video Authentication: A Physical Signature Against AI Video Generation
por: Qing, Yuan, et al.
Publicado: (2026)
por: Qing, Yuan, et al.
Publicado: (2026)
VideoConviction: A Multimodal Benchmark for Human Conviction and Stock Market Recommendations
por: Galarnyk, Michael, et al.
Publicado: (2025)
por: Galarnyk, Michael, et al.
Publicado: (2025)
Self-Adaptive Sampling for Efficient Video Question-Answering on Image--Text Models
por: Han, Wei, et al.
Publicado: (2023)
por: Han, Wei, et al.
Publicado: (2023)
Multimodal Cinematic Video Synthesis Using Text-to-Image and Audio Generation Models
por: S, Sridhar, et al.
Publicado: (2025)
por: S, Sridhar, et al.
Publicado: (2025)
TheoremExplainAgent: Towards Video-based Multimodal Explanations for LLM Theorem Understanding
por: Ku, Max, et al.
Publicado: (2025)
por: Ku, Max, et al.
Publicado: (2025)
Dual-Modal Attention-Enhanced Text-Video Retrieval with Triplet Partial Margin Contrastive Learning
por: Jiang, Chen, et al.
Publicado: (2023)
por: Jiang, Chen, et al.
Publicado: (2023)
VideoMind: A Chain-of-LoRA Agent for Temporal-Grounded Video Reasoning
por: Liu, Ye, et al.
Publicado: (2025)
por: Liu, Ye, et al.
Publicado: (2025)
AID: Adapting Image2Video Diffusion Models for Instruction-guided Video Prediction
por: Xing, Zhen, et al.
Publicado: (2024)
por: Xing, Zhen, et al.
Publicado: (2024)
SoccerHigh: A Benchmark Dataset for Automatic Soccer Video Summarization
por: Díaz-Juan, Artur, et al.
Publicado: (2025)
por: Díaz-Juan, Artur, et al.
Publicado: (2025)
Composing Concepts from Images and Videos via Concept-prompt Binding
por: Kong, Xianghao, et al.
Publicado: (2025)
por: Kong, Xianghao, et al.
Publicado: (2025)
VINCIE: Unlocking In-context Image Editing from Video
por: Qu, Leigang, et al.
Publicado: (2025)
por: Qu, Leigang, et al.
Publicado: (2025)
MAViS: A Multi-Agent Framework for Long-Sequence Video Storytelling
por: Wang, Qian, et al.
Publicado: (2025)
por: Wang, Qian, et al.
Publicado: (2025)
RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation
por: Chen, Tianxing, et al.
Publicado: (2025)
por: Chen, Tianxing, et al.
Publicado: (2025)
Enhanced Multimodal Hate Video Detection via Channel-wise and Modality-wise Fusion
por: Zhang, Yinghui, et al.
Publicado: (2025)
por: Zhang, Yinghui, et al.
Publicado: (2025)
A Survey on Generative AI and LLM for Video Generation, Understanding, and Streaming
por: Zhou, Pengyuan, et al.
Publicado: (2024)
por: Zhou, Pengyuan, et al.
Publicado: (2024)
Building a Precise Video Language with Human-AI Oversight
por: Lin, Zhiqiu, et al.
Publicado: (2026)
por: Lin, Zhiqiu, et al.
Publicado: (2026)
Towards Understanding Camera Motions in Any Video
por: Lin, Zhiqiu, et al.
Publicado: (2025)
por: Lin, Zhiqiu, et al.
Publicado: (2025)
Ejemplares similares
-
Paper2Poster: Towards Multimodal Poster Automation from Scientific Papers
por: Pang, Wei, et al.
Publicado: (2025) -
Code2Video: A Code-centric Paradigm for Educational Video Generation
por: Chen, Yanzhe, et al.
Publicado: (2025) -
Factorized Learning for Temporally Grounded Video-Language Models
por: Zeng, Wenzheng, et al.
Publicado: (2025) -
SEAgent: Self-Evolving Computer Use Agent with Autonomous Learning from Experience
por: Sun, Zeyi, et al.
Publicado: (2025) -
Don't Guess, Escalate: Towards Explainable Uncertainty-Calibrated AI Forensic Agents
por: Boato, Giulia, et al.
Publicado: (2025)