TripleSumm: Adaptive Triple-Modality Fusion for Video Summarization
Fuente:
arXiv
Guardado en:
| Autores principales: | Kim, Sumin, Jeong, Hyemin, Kang, Mingu, Kim, Yejin, Oh, Yoori, Lee, Joonseok |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
A More Word-like Image Tokenization for MLLMs
por: Lee, Hyun, et al.
Publicado: (2026)
por: Lee, Hyun, et al.
Publicado: (2026)
DIAMOND: An LLM-Driven Agent for Context-Aware Baseball Highlight Summarization
por: Kang, Jeonghun, et al.
Publicado: (2025)
por: Kang, Jeonghun, et al.
Publicado: (2025)
Sounding Highlights: Dual-Pathway Audio Encoders for Audio-Visual Video Highlight Detection
por: Joo, Seohyun, et al.
Publicado: (2026)
por: Joo, Seohyun, et al.
Publicado: (2026)
CLIP-KOA: Enhancing Knee Osteoarthritis Diagnosis with Multi-Modal Learning and Symmetry-Aware Loss Functions
por: Jeong, Yejin, et al.
Publicado: (2025)
por: Jeong, Yejin, et al.
Publicado: (2025)
DisCoRD: Discrete Tokens to Continuous Motion via Rectified Flow Decoding
por: Cho, Jungbin, et al.
Publicado: (2024)
por: Cho, Jungbin, et al.
Publicado: (2024)
SummDiff: Generative Modeling of Video Summarization with Diffusion
por: Kim, Kwanseok, et al.
Publicado: (2025)
por: Kim, Kwanseok, et al.
Publicado: (2025)
Tidiness Score-Guided Monte Carlo Tree Search for Visual Tabletop Rearrangement
por: Kee, Hogun, et al.
Publicado: (2025)
por: Kee, Hogun, et al.
Publicado: (2025)
FedCAR: Cross-client Adaptive Re-weighting for Generative Models in Federated Learning
por: Kim, Minjun, et al.
Publicado: (2024)
por: Kim, Minjun, et al.
Publicado: (2024)
Towards Visual Text Design Transfer Across Languages
por: Choi, Yejin, et al.
Publicado: (2024)
por: Choi, Yejin, et al.
Publicado: (2024)
TMI-CLNet: Triple-Modal Interaction Network for Chronic Liver Disease Prognosis From Imaging, Clinical, and Radiomic Data Fusion
por: Wu, Linglong, et al.
Publicado: (2025)
por: Wu, Linglong, et al.
Publicado: (2025)
TripleFDS: Triple Feature Disentanglement and Synthesis for Scene Text Editing
por: Bao, Yuchen, et al.
Publicado: (2025)
por: Bao, Yuchen, et al.
Publicado: (2025)
Triple Point Masking
por: Liu, Jiaming, et al.
Publicado: (2024)
por: Liu, Jiaming, et al.
Publicado: (2024)
FedSOL: Stabilized Orthogonal Learning with Proximal Restrictions in Federated Learning
por: Lee, Gihun, et al.
Publicado: (2023)
por: Lee, Gihun, et al.
Publicado: (2023)
MF2Summ: Multimodal Fusion for Video Summarization with Temporal Alignment
por: wang, Shuo, et al.
Publicado: (2025)
por: wang, Shuo, et al.
Publicado: (2025)
ArtSplat: Feed-Forward Articulated 3D Gaussian Splatting from Sparse Multi-State Uncalibrated Views
por: Lee, Inseo, et al.
Publicado: (2026)
por: Lee, Inseo, et al.
Publicado: (2026)
Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders
por: Lee, Dohun, et al.
Publicado: (2025)
por: Lee, Dohun, et al.
Publicado: (2025)
Tuning-Free Multi-Event Long Video Generation via Synchronized Coupled Sampling
por: Kim, Subin, et al.
Publicado: (2025)
por: Kim, Subin, et al.
Publicado: (2025)
Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing
por: Lee, Hosu, et al.
Publicado: (2024)
por: Lee, Hosu, et al.
Publicado: (2024)
CLIP Can Understand Depth
por: Kim, Sohee, et al.
Publicado: (2024)
por: Kim, Sohee, et al.
Publicado: (2024)
EdgeFusion: On-Device Text-to-Image Generation
por: Castells, Thibault, et al.
Publicado: (2024)
por: Castells, Thibault, et al.
Publicado: (2024)
QEVA: A Reference-Free Evaluation Metric for Narrative Video Summarization with Multimodal Question Answering
por: Jung, Woojun, et al.
Publicado: (2026)
por: Jung, Woojun, et al.
Publicado: (2026)
Triple Spectral Fusion for Sensor-based Human Activity Recognition
por: Zhang, Ye, et al.
Publicado: (2026)
por: Zhang, Ye, et al.
Publicado: (2026)
MIRROR: Multimodal Cognitive Reframing Therapy for Rolling with Resistance
por: Kim, Subin, et al.
Publicado: (2025)
por: Kim, Subin, et al.
Publicado: (2025)
LVSum: A Benchmark for Timestamp-Aware Long Video Summarization
por: Patel, Alkesh, et al.
Publicado: (2026)
por: Patel, Alkesh, et al.
Publicado: (2026)
Task Prototype-Based Knowledge Retrieval for Multi-Task Learning from Partially Annotated Data
por: Oh, Youngmin, et al.
Publicado: (2026)
por: Oh, Youngmin, et al.
Publicado: (2026)
AdaRank: Adaptive Rank Pruning for Enhanced Model Merging
por: Lee, Chanhyuk, et al.
Publicado: (2025)
por: Lee, Chanhyuk, et al.
Publicado: (2025)
VideoGuide: Improving Video Diffusion Models without Training Through a Teacher's Guide
por: Lee, Dohun, et al.
Publicado: (2024)
por: Lee, Dohun, et al.
Publicado: (2024)
HierSum: A Global and Local Attention Mechanism for Video Summarization
por: Beedu, Apoorva, et al.
Publicado: (2025)
por: Beedu, Apoorva, et al.
Publicado: (2025)
FIQ: Fundamental Question Generation with the Integration of Question Embeddings for Video Question Answering
por: Oh, Ju-Young, et al.
Publicado: (2025)
por: Oh, Ju-Young, et al.
Publicado: (2025)
Exploring the Spectrum of Visio-Linguistic Compositionality and Recognition
por: Oh, Youngtaek, et al.
Publicado: (2024)
por: Oh, Youngtaek, et al.
Publicado: (2024)
Efficient Neural Video Representation with Temporally Coherent Modulation
por: Shin, Seungjun, et al.
Publicado: (2025)
por: Shin, Seungjun, et al.
Publicado: (2025)
Video Face Re-Aging: Toward Temporally Consistent Face Re-Aging
por: Muqeet, Abdul, et al.
Publicado: (2023)
por: Muqeet, Abdul, et al.
Publicado: (2023)
OTT-Vid: Optimal Transport Temporal Token Compression for Video Large Language Models
por: Kang, Minseok, et al.
Publicado: (2026)
por: Kang, Minseok, et al.
Publicado: (2026)
ReSpec: Relevance and Specificity Grounded Online Filtering for Learning on Video-Text Data Streams
por: Kim, Chris Dongjoo, et al.
Publicado: (2025)
por: Kim, Chris Dongjoo, et al.
Publicado: (2025)
Exploring a Multimodal Fusion-based Deep Learning Network for Detecting Facial Palsy
por: Oo, Heng Yim Nicole, et al.
Publicado: (2024)
por: Oo, Heng Yim Nicole, et al.
Publicado: (2024)
Simultaneous Long-tailed Recognition and Multi-modal Fusion for Highly Imbalanced Multi-modal Data
por: Yoon, Heegeon, et al.
Publicado: (2026)
por: Yoon, Heegeon, et al.
Publicado: (2026)
Latent Expression Generation for Referring Image Segmentation and Grounding
por: Yu, Seonghoon, et al.
Publicado: (2025)
por: Yu, Seonghoon, et al.
Publicado: (2025)
JUDO: A Juxtaposed Domain-Oriented Multimodal Reasoner for Industrial Anomaly QA
por: Kang, Hyunju, et al.
Publicado: (2026)
por: Kang, Hyunju, et al.
Publicado: (2026)
V2Xum-LLM: Cross-Modal Video Summarization with Temporal Prompt Instruction Tuning
por: Hua, Hang, et al.
Publicado: (2024)
por: Hua, Hang, et al.
Publicado: (2024)
Progressive Fourier Neural Representation for Sequential Video Compilation
por: Kang, Haeyong, et al.
Publicado: (2023)
por: Kang, Haeyong, et al.
Publicado: (2023)
Ejemplares similares
-
A More Word-like Image Tokenization for MLLMs
por: Lee, Hyun, et al.
Publicado: (2026) -
DIAMOND: An LLM-Driven Agent for Context-Aware Baseball Highlight Summarization
por: Kang, Jeonghun, et al.
Publicado: (2025) -
Sounding Highlights: Dual-Pathway Audio Encoders for Audio-Visual Video Highlight Detection
por: Joo, Seohyun, et al.
Publicado: (2026) -
CLIP-KOA: Enhancing Knee Osteoarthritis Diagnosis with Multi-Modal Learning and Symmetry-Aware Loss Functions
por: Jeong, Yejin, et al.
Publicado: (2025) -
DisCoRD: Discrete Tokens to Continuous Motion via Rectified Flow Decoding
por: Cho, Jungbin, et al.
Publicado: (2024)