CFSum: A Transformer-Based Multi-Modal Video Summarization Framework With Coarse-Fine Fusion
Fuente:
arXiv
Salvato in:
| Autori principali: | Guo, Yaowei, Xing, Jiazheng, Hou, Xiaojun, Xin, Shuo, Jiang, Juntao, Terzopoulos, Demetri, Jiang, Chenfanfu, Liu, Yong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
AnimaMimic: Imitating 3D Animation from Video Priors
di: Xie, Tianyi, et al.
Pubblicazione: (2025)
di: Xie, Tianyi, et al.
Pubblicazione: (2025)
Prompting Medical Large Vision-Language Models to Diagnose Pathologies by Visual Question Answering
di: Guo, Danfeng, et al.
Pubblicazione: (2024)
di: Guo, Danfeng, et al.
Pubblicazione: (2024)
SDSTrack: Self-Distillation Symmetric Adapter Learning for Multi-Modal Visual Object Tracking
di: Hou, Xiaojun, et al.
Pubblicazione: (2024)
di: Hou, Xiaojun, et al.
Pubblicazione: (2024)
Unstructured Moving Least Squares Material Point Methods: A Stable Kernel Approach With Continuous Gradient Reconstruction on General Unstructured Tessellations
di: Cao, Yadi, et al.
Pubblicazione: (2023)
di: Cao, Yadi, et al.
Pubblicazione: (2023)
TeamCraft: A Benchmark for Multi-Modal Multi-Agent Systems in Minecraft
di: Long, Qian, et al.
Pubblicazione: (2024)
di: Long, Qian, et al.
Pubblicazione: (2024)
Visual Object Tracking across Diverse Data Modalities: A Review
di: Wang, Mengmeng, et al.
Pubblicazione: (2024)
di: Wang, Mengmeng, et al.
Pubblicazione: (2024)
MPM Lite: Linear Kernels and Integration without Particles
di: Feng, Xiang, et al.
Pubblicazione: (2026)
di: Feng, Xiang, et al.
Pubblicazione: (2026)
Inverse Attention Agents for Multi-Agent Systems
di: Long, Qian, et al.
Pubblicazione: (2024)
di: Long, Qian, et al.
Pubblicazione: (2024)
A Human-centric Framework for Debating the Ethics of AI Consciousness Under Uncertainty
di: Ziheng, Zhou, et al.
Pubblicazione: (2025)
di: Ziheng, Zhou, et al.
Pubblicazione: (2025)
Substepping the Material Point Method
di: Jiang, Chenfanfu
Pubblicazione: (2025)
di: Jiang, Chenfanfu
Pubblicazione: (2025)
Repeating Words for Video-Language Retrieval with Coarse-to-Fine Objectives
di: Zhao, Haoyu, et al.
Pubblicazione: (2025)
di: Zhao, Haoyu, et al.
Pubblicazione: (2025)
Video Quality Assessment Based on Swin TransformerV2 and Coarse to Fine Strategy
di: Yu, Zihao, et al.
Pubblicazione: (2024)
di: Yu, Zihao, et al.
Pubblicazione: (2024)
Learning Neural Force Manifolds for Sim2Real Robotic Symmetrical Paper Folding
di: Choi, Andrew, et al.
Pubblicazione: (2023)
di: Choi, Andrew, et al.
Pubblicazione: (2023)
MF2Summ: Multimodal Fusion for Video Summarization with Temporal Alignment
di: wang, Shuo, et al.
Pubblicazione: (2025)
di: wang, Shuo, et al.
Pubblicazione: (2025)
TripleSumm: Adaptive Triple-Modality Fusion for Video Summarization
di: Kim, Sumin, et al.
Pubblicazione: (2026)
di: Kim, Sumin, et al.
Pubblicazione: (2026)
M2-CLIP: A Multimodal, Multi-task Adapting Framework for Video Action Recognition
di: Wang, Mengmeng, et al.
Pubblicazione: (2024)
di: Wang, Mengmeng, et al.
Pubblicazione: (2024)
Unveiling the Depths: A Multi-Modal Fusion Framework for Challenging Scenarios
di: Xu, Jialei, et al.
Pubblicazione: (2024)
di: Xu, Jialei, et al.
Pubblicazione: (2024)
Harmony: A Unified Framework for Modality Incremental Learning
di: Song, Yaguang, et al.
Pubblicazione: (2025)
di: Song, Yaguang, et al.
Pubblicazione: (2025)
LiDAR-VGGT: Cross-Modal Coarse-to-Fine Fusion for Globally Consistent and Metric-Scale Dense Mapping
di: Wang, Lijie, et al.
Pubblicazione: (2025)
di: Wang, Lijie, et al.
Pubblicazione: (2025)
Removal then Selection: A Coarse-to-Fine Fusion Perspective for RGB-Infrared Object Detection
di: Zhao, Tianyi, et al.
Pubblicazione: (2024)
di: Zhao, Tianyi, et al.
Pubblicazione: (2024)
mBEST: Realtime Deformable Linear Object Detection Through Minimal Bending Energy Skeleton Pixel Traversals
di: Choi, Andrew, et al.
Pubblicazione: (2023)
di: Choi, Andrew, et al.
Pubblicazione: (2023)
Fovea Transformer: Efficient Long-Context Modeling with Structured Fine-to-Coarse Attention
di: He, Ziwei, et al.
Pubblicazione: (2023)
di: He, Ziwei, et al.
Pubblicazione: (2023)
Cross-Slice Attention and Evidential Critical Loss for Uncertainty-Aware Prostate Cancer Detection
di: Hung, Alex Ling Yu, et al.
Pubblicazione: (2024)
di: Hung, Alex Ling Yu, et al.
Pubblicazione: (2024)
CAFE: Retrieval Head-based Coarse-to-Fine Information Seeking to Enhance Multi-Document QA Capability
di: Peng, Han, et al.
Pubblicazione: (2025)
di: Peng, Han, et al.
Pubblicazione: (2025)
A Coarse-to-Fine Approach to Multi-Modality 3D Occupancy Grounding
di: Shi, Zhan, et al.
Pubblicazione: (2025)
di: Shi, Zhan, et al.
Pubblicazione: (2025)
Balancing Speciality and Versatility: A Coarse to Fine Framework for Mitigating Catastrophic Forgetting in Large Language Models
di: Zhang, Hengyuan, et al.
Pubblicazione: (2024)
di: Zhang, Hengyuan, et al.
Pubblicazione: (2024)
Progtuning: Progressive Fine-tuning Framework for Transformer-based Language Models
di: Ji, Xiaoshuang, et al.
Pubblicazione: (2025)
di: Ji, Xiaoshuang, et al.
Pubblicazione: (2025)
CART: A Generative Cross-Modal Retrieval Framework with Coarse-To-Fine Semantic Modeling
di: Fang, Minghui, et al.
Pubblicazione: (2024)
di: Fang, Minghui, et al.
Pubblicazione: (2024)
Raccoon: Multi-stage Diffusion Training with Coarse-to-Fine Curating Videos
di: Tan, Zhiyu, et al.
Pubblicazione: (2025)
di: Tan, Zhiyu, et al.
Pubblicazione: (2025)
Review of Deep Learning Applications to Structural Proteomics Enabled by Cryogenic Electron Microscopy and Tomography
di: Zhou, Brady K., et al.
Pubblicazione: (2025)
di: Zhou, Brady K., et al.
Pubblicazione: (2025)
FullTransNet: Full Transformer with Local-Global Attention for Video Summarization
di: Lan, Libin, et al.
Pubblicazione: (2025)
di: Lan, Libin, et al.
Pubblicazione: (2025)
Circumventing volumetric locking in explicit material point methods: A simple, efficient, and general approach
di: Zhao, Yidong, et al.
Pubblicazione: (2022)
di: Zhao, Yidong, et al.
Pubblicazione: (2022)
A Convex Formulation of Frictional Contact for the Material Point Method and Rigid Bodies
di: Zong, Zeshun, et al.
Pubblicazione: (2024)
di: Zong, Zeshun, et al.
Pubblicazione: (2024)
Chinese Stock Prediction Based on a Multi-Modal Transformer Framework: Macro-Micro Information Fusion
di: AI, Lumen, et al.
Pubblicazione: (2025)
di: AI, Lumen, et al.
Pubblicazione: (2025)
Multi-Modal Sensing and Fusion in mmWave Beamforming for Connected Vehicles: A Transformer Based Framework
di: Mollah, Muhammad Baqer, et al.
Pubblicazione: (2026)
di: Mollah, Muhammad Baqer, et al.
Pubblicazione: (2026)
AlignMamba-2: Enhancing Multimodal Fusion and Sentiment Analysis with Modality-Aware Mamba
di: Li, Yan, et al.
Pubblicazione: (2026)
di: Li, Yan, et al.
Pubblicazione: (2026)
MS-DETR: Multispectral Pedestrian Detection Transformer with Loosely Coupled Fusion and Modality-Balanced Optimization
di: Xing, Yinghui, et al.
Pubblicazione: (2023)
di: Xing, Yinghui, et al.
Pubblicazione: (2023)
PhysAnimator: Physics-Guided Generative Cartoon Animation
di: Xie, Tianyi, et al.
Pubblicazione: (2025)
di: Xie, Tianyi, et al.
Pubblicazione: (2025)
SUMFORU: An LLM-Based Review Summarization Framework for Personalized Purchase Decision Support
di: Feng, Yuming, et al.
Pubblicazione: (2025)
di: Feng, Yuming, et al.
Pubblicazione: (2025)
An Integrated Framework for Multi-Granular Explanation of Video Summarization
di: Tsigos, Konstantinos, et al.
Pubblicazione: (2024)
di: Tsigos, Konstantinos, et al.
Pubblicazione: (2024)
Documenti analoghi
-
AnimaMimic: Imitating 3D Animation from Video Priors
di: Xie, Tianyi, et al.
Pubblicazione: (2025) -
Prompting Medical Large Vision-Language Models to Diagnose Pathologies by Visual Question Answering
di: Guo, Danfeng, et al.
Pubblicazione: (2024) -
SDSTrack: Self-Distillation Symmetric Adapter Learning for Multi-Modal Visual Object Tracking
di: Hou, Xiaojun, et al.
Pubblicazione: (2024) -
Unstructured Moving Least Squares Material Point Methods: A Stable Kernel Approach With Continuous Gradient Reconstruction on General Unstructured Tessellations
di: Cao, Yadi, et al.
Pubblicazione: (2023) -
TeamCraft: A Benchmark for Multi-Modal Multi-Agent Systems in Minecraft
di: Long, Qian, et al.
Pubblicazione: (2024)