Integrating Video and Text: A Balanced Approach to Multimodal Summary Generation and Evaluation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Pennec, Galann, Liu, Zhengyuan, Asher, Nicholas, Muller, Philippe, Chen, Nancy F. |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Minimal Clips, Maximum Salience: Long Video Summarization via Key Moment Extraction
par: Pennec, Galann, et autres
Publié: (2025)
par: Pennec, Galann, et autres
Publié: (2025)
FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation
par: Jing, Liqiang, et autres
Publié: (2025)
par: Jing, Liqiang, et autres
Publié: (2025)
MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities
par: Yu, Weihao, et autres
Publié: (2023)
par: Yu, Weihao, et autres
Publié: (2023)
ChronoMagic-Bench: A Benchmark for Metamorphic Evaluation of Text-to-Time-lapse Video Generation
par: Yuan, Shenghai, et autres
Publié: (2024)
par: Yuan, Shenghai, et autres
Publié: (2024)
Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm
par: Tong, Jingqi, et autres
Publié: (2025)
par: Tong, Jingqi, et autres
Publié: (2025)
Design2Code: Benchmarking Multimodal Code Generation for Automated Front-End Engineering
par: Si, Chenglei, et autres
Publié: (2024)
par: Si, Chenglei, et autres
Publié: (2024)
MM-Vet v2: A Challenging Benchmark to Evaluate Large Multimodal Models for Integrated Capabilities
par: Yu, Weihao, et autres
Publié: (2024)
par: Yu, Weihao, et autres
Publié: (2024)
Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization
par: Islam, Md Moinul, et autres
Publié: (2025)
par: Islam, Md Moinul, et autres
Publié: (2025)
The Devil is in the Prompts: Retrieval-Augmented Prompt Optimization for Text-to-Video Generation
par: Gao, Bingjie, et autres
Publié: (2025)
par: Gao, Bingjie, et autres
Publié: (2025)
Evaluating the Evaluators: Metrics for Compositional Text-to-Image Generation
par: Kasaei, Seyed Amir, et autres
Publié: (2025)
par: Kasaei, Seyed Amir, et autres
Publié: (2025)
Evaluating Multimodal Large Language Models on Vertically Written Japanese Text
par: Sasagawa, Keito, et autres
Publié: (2025)
par: Sasagawa, Keito, et autres
Publié: (2025)
Multimodal Integration of Human-Like Attention in Visual Question Answering
par: Sood, Ekta, et autres
Publié: (2021)
par: Sood, Ekta, et autres
Publié: (2021)
Text2Vis: A Challenging and Diverse Benchmark for Generating Multimodal Visualizations from Text
par: Rahman, Mizanur, et autres
Publié: (2025)
par: Rahman, Mizanur, et autres
Publié: (2025)
Step-Video-TI2V Technical Report: A State-of-the-Art Text-Driven Image-to-Video Generation Model
par: Huang, Haoyang, et autres
Publié: (2025)
par: Huang, Haoyang, et autres
Publié: (2025)
Modality-Agnostic fMRI Decoding of Vision and Language
par: Nikolaus, Mitja, et autres
Publié: (2024)
par: Nikolaus, Mitja, et autres
Publié: (2024)
Temporal Reasoning Transfer from Text to Video
par: Li, Lei, et autres
Publié: (2024)
par: Li, Lei, et autres
Publié: (2024)
VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos
par: Song, Tingyu, et autres
Publié: (2025)
par: Song, Tingyu, et autres
Publié: (2025)
Multimodal RewardBench 2: Evaluating Omni Reward Models for Interleaved Text and Image
par: Hu, Yushi, et autres
Publié: (2025)
par: Hu, Yushi, et autres
Publié: (2025)
MIA-Bench: Towards Better Instruction Following Evaluation of Multimodal LLMs
par: Qian, Yusu, et autres
Publié: (2024)
par: Qian, Yusu, et autres
Publié: (2024)
MINOS: A Multimodal Evaluation Model for Bidirectional Generation Between Image and Text
par: Zhang, Junzhe, et autres
Publié: (2025)
par: Zhang, Junzhe, et autres
Publié: (2025)
Training-free Guidance in Text-to-Video Generation via Multimodal Planning and Structured Noise Initialization
par: Li, Jialu, et autres
Publié: (2025)
par: Li, Jialu, et autres
Publié: (2025)
Multimodal Representation Alignment for Image Generation: Text-Image Interleaved Control Is Easier Than You Think
par: Chen, Liang, et autres
Publié: (2025)
par: Chen, Liang, et autres
Publié: (2025)
From Long Videos to Engaging Clips: A Human-Inspired Video Editing Framework with Multimodal Narrative Understanding
par: Wang, Xiangfeng, et autres
Publié: (2025)
par: Wang, Xiangfeng, et autres
Publié: (2025)
Why 1 + 1 < 1 in Visual Token Pruning: Beyond Naive Integration via Multi-Objective Balanced Covering
par: Li, Yangfu, et autres
Publié: (2025)
par: Li, Yangfu, et autres
Publié: (2025)
Multimodal LLMs as Customized Reward Models for Text-to-Image Generation
par: Zhou, Shijie, et autres
Publié: (2025)
par: Zhou, Shijie, et autres
Publié: (2025)
MMSummary: Multimodal Summary Generation for Fetal Ultrasound Video
par: Guo, Xiaoqing, et autres
Publié: (2024)
par: Guo, Xiaoqing, et autres
Publié: (2024)
EVALALIGN: Supervised Fine-Tuning Multimodal LLMs with Human-Aligned Data for Evaluating Text-to-Image Models
par: Tan, Zhiyu, et autres
Publié: (2024)
par: Tan, Zhiyu, et autres
Publié: (2024)
Interleaved Scene Graphs for Interleaved Text-and-Image Generation Assessment
par: Chen, Dongping, et autres
Publié: (2024)
par: Chen, Dongping, et autres
Publié: (2024)
TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation
par: Feng, Weixi, et autres
Publié: (2024)
par: Feng, Weixi, et autres
Publié: (2024)
Reading, Not Thinking: Understanding and Bridging the Modality Gap When Text Becomes Pixels in Multimodal LLMs
par: Sun, Kaiser, et autres
Publié: (2026)
par: Sun, Kaiser, et autres
Publié: (2026)
Scaling Text-Rich Image Understanding via Code-Guided Synthetic Multimodal Data Generation
par: Yang, Yue, et autres
Publié: (2025)
par: Yang, Yue, et autres
Publié: (2025)
Image2Text2Image: A Novel Framework for Label-Free Evaluation of Image-to-Text Generation with Text-to-Image Diffusion Models
par: Huang, Jia-Hong, et autres
Publié: (2024)
par: Huang, Jia-Hong, et autres
Publié: (2024)
A Multimodal In-Context Tuning Approach for E-Commerce Product Description Generation
par: Li, Yunxin, et autres
Publié: (2024)
par: Li, Yunxin, et autres
Publié: (2024)
MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos
par: Zhu, Kejian, et autres
Publié: (2025)
par: Zhu, Kejian, et autres
Publié: (2025)
HawkEye: Training Video-Text LLMs for Grounding Text in Videos
par: Wang, Yueqian, et autres
Publié: (2024)
par: Wang, Yueqian, et autres
Publié: (2024)
American Sign Language Video to Text Translation
par: Roy, Parsheeta, et autres
Publié: (2024)
par: Roy, Parsheeta, et autres
Publié: (2024)
OSCBench: Benchmarking Object State Change in Text-to-Video Generation
par: Han, Xianjing, et autres
Publié: (2026)
par: Han, Xianjing, et autres
Publié: (2026)
Holistic Evaluation for Interleaved Text-and-Image Generation
par: Liu, Minqian, et autres
Publié: (2024)
par: Liu, Minqian, et autres
Publié: (2024)
OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models
par: Yu, Wenwen, et autres
Publié: (2025)
par: Yu, Wenwen, et autres
Publié: (2025)
UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs
par: Jiang, Houcheng, et autres
Publié: (2026)
par: Jiang, Houcheng, et autres
Publié: (2026)
Documents similaires
-
Minimal Clips, Maximum Salience: Long Video Summarization via Key Moment Extraction
par: Pennec, Galann, et autres
Publié: (2025) -
FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation
par: Jing, Liqiang, et autres
Publié: (2025) -
MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities
par: Yu, Weihao, et autres
Publié: (2023) -
ChronoMagic-Bench: A Benchmark for Metamorphic Evaluation of Text-to-Time-lapse Video Generation
par: Yuan, Shenghai, et autres
Publié: (2024) -
Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm
par: Tong, Jingqi, et autres
Publié: (2025)