Scaling Up Video Summarization Pretraining with Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Argaw, Dawit Mureja, Yoon, Seunghyun, Heilbron, Fabian Caba, Deilamsalehy, Hanieh, Bui, Trung, Wang, Zhaowen, Dernoncourt, Franck, Chung, Joon Son |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Towards Enhancing Coherence in Extractive Summarization: Dataset and Experiments with LLMs
por: Parmar, Mihir, et al.
Publicado: (2024)
por: Parmar, Mihir, et al.
Publicado: (2024)
Towards Automated Movie Trailer Generation
por: Argaw, Dawit Mureja, et al.
Publicado: (2024)
por: Argaw, Dawit Mureja, et al.
Publicado: (2024)
MambaVideo for Discrete Video Tokenization with Channel-Split Quantization
por: Argaw, Dawit Mureja, et al.
Publicado: (2025)
por: Argaw, Dawit Mureja, et al.
Publicado: (2025)
Identifying Speakers in Dialogue Transcripts: A Text-based Approach Using Pretrained Language Models
por: Nguyen, Minh, et al.
Publicado: (2024)
por: Nguyen, Minh, et al.
Publicado: (2024)
NoLiMa: Long-Context Evaluation Beyond Literal Matching
por: Modarressi, Ali, et al.
Publicado: (2025)
por: Modarressi, Ali, et al.
Publicado: (2025)
CORG: Generating Answers from Complex, Interrelated Contexts
por: Lee, Hyunji, et al.
Publicado: (2025)
por: Lee, Hyunji, et al.
Publicado: (2025)
MS4UI: A Dataset for Multi-modal Summarization of User Interface Instructional Videos
por: Zang, Yuan, et al.
Publicado: (2025)
por: Zang, Yuan, et al.
Publicado: (2025)
Can Large Language Models Keep Up? Benchmarking Online Adaptation to Continual Knowledge Streams
por: Kim, Jiyeon, et al.
Publicado: (2026)
por: Kim, Jiyeon, et al.
Publicado: (2026)
Steering MoE LLMs via Expert (De)Activation
por: Fayyaz, Mohsen, et al.
Publicado: (2025)
por: Fayyaz, Mohsen, et al.
Publicado: (2025)
Sync from the Sea: Retrieving Alignable Videos from Large-Scale Datasets
por: Dave, Ishan Rajendrakumar, et al.
Publicado: (2024)
por: Dave, Ishan Rajendrakumar, et al.
Publicado: (2024)
SlimLM: An Efficient Small Language Model for On-Device Document Assistance
por: Pham, Thang M., et al.
Publicado: (2024)
por: Pham, Thang M., et al.
Publicado: (2024)
Fine-tuning CLIP Text Encoders with Two-step Paraphrasing
por: Kim, Hyunjae, et al.
Publicado: (2024)
por: Kim, Hyunjae, et al.
Publicado: (2024)
VideoMap: Supporting Video Editing Exploration, Brainstorming, and Prototyping in the Latent Space
por: Lin, David Chuan-En, et al.
Publicado: (2022)
por: Lin, David Chuan-En, et al.
Publicado: (2022)
ViT-AdaLA: Adapting Vision Transformers with Linear Attention
por: Li, Yifan, et al.
Publicado: (2026)
por: Li, Yifan, et al.
Publicado: (2026)
Videogenic: Identifying Highlight Moments in Videos with Professional Photographs as a Prior
por: Lin, David Chuan-En, et al.
Publicado: (2022)
por: Lin, David Chuan-En, et al.
Publicado: (2022)
Lizard: An Efficient Linearization Framework for Large Language Models
por: Van Nguyen, Chien, et al.
Publicado: (2025)
por: Van Nguyen, Chien, et al.
Publicado: (2025)
StreamGaze: Gaze-Guided Temporal Reasoning and Proactive Understanding in Streaming Videos
por: Lee, Daeun, et al.
Publicado: (2025)
por: Lee, Daeun, et al.
Publicado: (2025)
ResidualViT for Efficient Temporally Dense Video Encoding
por: Soldan, Mattia, et al.
Publicado: (2025)
por: Soldan, Mattia, et al.
Publicado: (2025)
FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation
por: Jing, Liqiang, et al.
Publicado: (2025)
por: Jing, Liqiang, et al.
Publicado: (2025)
Retrieval Augmented Generation for Domain-specific Question Answering
por: Sharma, Sanat, et al.
Publicado: (2024)
por: Sharma, Sanat, et al.
Publicado: (2024)
Multi-LLM Text Summarization
por: Fang, Jiangnan, et al.
Publicado: (2024)
por: Fang, Jiangnan, et al.
Publicado: (2024)
Self-Debiasing Large Language Models: Zero-Shot Recognition and Reduction of Stereotypes
por: Gallegos, Isabel O., et al.
Publicado: (2024)
por: Gallegos, Isabel O., et al.
Publicado: (2024)
Taipan: Efficient and Expressive State Space Language Models with Selective Attention
por: Van Nguyen, Chien, et al.
Publicado: (2024)
por: Van Nguyen, Chien, et al.
Publicado: (2024)
Personalized Graph-Based Retrieval for Large Language Models
por: Au, Steven, et al.
Publicado: (2025)
por: Au, Steven, et al.
Publicado: (2025)
EditDuet: A Multi-Agent System for Video Non-Linear Editing
por: Sandoval-Castaneda, Marcelo, et al.
Publicado: (2025)
por: Sandoval-Castaneda, Marcelo, et al.
Publicado: (2025)
DynaSaur: Large Language Agents Beyond Predefined Actions
por: Nguyen, Dang, et al.
Publicado: (2024)
por: Nguyen, Dang, et al.
Publicado: (2024)
Toward Robust Hyper-Detailed Image Captioning: A Multiagent Approach and Dual Evaluation Metrics for Factuality and Coverage
por: Lee, Saehyung, et al.
Publicado: (2024)
por: Lee, Saehyung, et al.
Publicado: (2024)
Concept Weaver: Enabling Multi-Concept Fusion in Text-to-Image Models
por: Kwon, Gihyun, et al.
Publicado: (2024)
por: Kwon, Gihyun, et al.
Publicado: (2024)
ULLME: A Unified Framework for Large Language Model Embeddings with Generation-Augmented Learning
por: Man, Hieu, et al.
Publicado: (2024)
por: Man, Hieu, et al.
Publicado: (2024)
Instruction Tuning with and without Context: Behavioral Shifts and Downstream Impact
por: Lee, Hyunji, et al.
Publicado: (2025)
por: Lee, Hyunji, et al.
Publicado: (2025)
Blind to the Human Touch: Overlap Bias in LLM-Based Summary Evaluation
por: Fang, Jiangnan, et al.
Publicado: (2026)
por: Fang, Jiangnan, et al.
Publicado: (2026)
Agentic Planning with Reasoning for Image Styling via Offline RL
por: Mukherjee, Subhojyoti, et al.
Publicado: (2026)
por: Mukherjee, Subhojyoti, et al.
Publicado: (2026)
Adapting Dual-encoder Vision-language Models for Paraphrased Retrieval
por: Cheng, Jiacheng, et al.
Publicado: (2024)
por: Cheng, Jiacheng, et al.
Publicado: (2024)
Scaling Up Summarization: Leveraging Large Language Models for Long Text Extractive Summarization
por: Hemamou, Léo, et al.
Publicado: (2024)
por: Hemamou, Léo, et al.
Publicado: (2024)
mSCoRe: a $M$ultilingual and Scalable Benchmark for $S$kill-based $Co$mmonsense $Re$asoning
por: Ngo, Nghia Trung, et al.
Publicado: (2025)
por: Ngo, Nghia Trung, et al.
Publicado: (2025)
PEEB: Part-based Image Classifiers with an Explainable and Editable Language Bottleneck
por: Pham, Thang M., et al.
Publicado: (2024)
por: Pham, Thang M., et al.
Publicado: (2024)
A Multi-LLM Debiasing Framework
por: Owens, Deonna M., et al.
Publicado: (2024)
por: Owens, Deonna M., et al.
Publicado: (2024)
Video Color Grading via Look-Up Table Generation
por: Shin, Seunghyun, et al.
Publicado: (2025)
por: Shin, Seunghyun, et al.
Publicado: (2025)
Discovering Divergent Representations between Text-to-Image Models
por: Dunlap, Lisa, et al.
Publicado: (2025)
por: Dunlap, Lisa, et al.
Publicado: (2025)
Improving Personalized Search with Regularized Low-Rank Parameter Updates
por: Ryan, Fiona, et al.
Publicado: (2025)
por: Ryan, Fiona, et al.
Publicado: (2025)
Ejemplares similares
-
Towards Enhancing Coherence in Extractive Summarization: Dataset and Experiments with LLMs
por: Parmar, Mihir, et al.
Publicado: (2024) -
Towards Automated Movie Trailer Generation
por: Argaw, Dawit Mureja, et al.
Publicado: (2024) -
MambaVideo for Discrete Video Tokenization with Channel-Split Quantization
por: Argaw, Dawit Mureja, et al.
Publicado: (2025) -
Identifying Speakers in Dialogue Transcripts: A Text-based Approach Using Pretrained Language Models
por: Nguyen, Minh, et al.
Publicado: (2024) -
NoLiMa: Long-Context Evaluation Beyond Literal Matching
por: Modarressi, Ali, et al.
Publicado: (2025)