Enhancing Video Summarization with Context Awareness
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Huynh-Lam, Hai-Dang, Ho-Thi, Ngoc-Phuong, Tran, Minh-Triet, Le, Trung-Nghia |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Cluster-based Video Summarization with Temporal Context Awareness
par: Huynh-Lam, Hai-Dang, et autres
Publié: (2024)
par: Huynh-Lam, Hai-Dang, et autres
Publié: (2024)
MasHeNe: A Benchmark for Head and Neck CT Mass Segmentation using Window-Enhanced Mamba with Frequency-Domain Integration
par: Dao, Thao Thi Phuong, et autres
Publié: (2025)
par: Dao, Thao Thi Phuong, et autres
Publié: (2025)
Interactive Interface For Semantic Segmentation Dataset Synthesis
par: Tran, Ngoc-Do, et autres
Publié: (2025)
par: Tran, Ngoc-Do, et autres
Publié: (2025)
GenFlow: Interactive Modular System for Image Generation
par: Nguyen, Duc-Hung, et autres
Publié: (2025)
par: Nguyen, Duc-Hung, et autres
Publié: (2025)
SAMURAI: Shape-Aware Multimodal Retrieval for 3D Object Identification
par: Vo, Dinh-Khoi, et autres
Publié: (2025)
par: Vo, Dinh-Khoi, et autres
Publié: (2025)
EVENT-Retriever: Event-Aware Multimodal Image Retrieval for Realistic Captions
par: Vo, Dinh-Khoi, et autres
Publié: (2025)
par: Vo, Dinh-Khoi, et autres
Publié: (2025)
Vision-Aware Text Features in Referring Image Segmentation: From Object Understanding to Context Understanding
par: Nguyen-Truong, Hai, et autres
Publié: (2024)
par: Nguyen-Truong, Hai, et autres
Publié: (2024)
ReCap: Event-Aware Image Captioning with Article Retrieval and Semantic Gaussian Normalization
par: Nguyen, Thinh-Phuc, et autres
Publié: (2025)
par: Nguyen, Thinh-Phuc, et autres
Publié: (2025)
DuFal: Dual-Frequency-Aware Learning for High-Fidelity Extremely Sparse-view CBCT Reconstruction
par: Van, Cuong Tran, et autres
Publié: (2026)
par: Van, Cuong Tran, et autres
Publié: (2026)
GUNNEL: Guided Mixup Augmentation and Multi-Model Fusion for Aquatic Animal Segmentation
par: Le, Minh-Quan, et autres
Publié: (2021)
par: Le, Minh-Quan, et autres
Publié: (2021)
CPAM: Context-Preserving Adaptive Manipulation for Zero-Shot Real Image Editing
par: Vo, Dinh-Khoi, et autres
Publié: (2025)
par: Vo, Dinh-Khoi, et autres
Publié: (2025)
Ensemble Learning for Vietnamese Scene Text Spotting in Urban Environments
par: Nguyen, Hieu, et autres
Publié: (2024)
par: Nguyen, Hieu, et autres
Publié: (2024)
QTSeg: A Query Token-Based Dual-Mix Attention Framework with Multi-Level Feature Distribution for Medical Image Segmentation
par: Tran, Phuong-Nam, et autres
Publié: (2024)
par: Tran, Phuong-Nam, et autres
Publié: (2024)
Aleatoric Uncertainty Medical Image Segmentation Estimation via Flow Matching
par: Van Nguyen, Phi, et autres
Publié: (2025)
par: Van Nguyen, Phi, et autres
Publié: (2025)
Context-Aware Pseudo-Label Scoring for Zero-Shot Video Summarization
par: Wu, Yuanli, et autres
Publié: (2025)
par: Wu, Yuanli, et autres
Publié: (2025)
VisionGuard: Synergistic Framework for Helmet Violation Detection
par: Nguyen, Lam-Huy, et autres
Publié: (2025)
par: Nguyen, Lam-Huy, et autres
Publié: (2025)
TaleForge: Interactive Multimodal System for Personalized Story Creation
par: Nguyen, Minh-Loi, et autres
Publié: (2025)
par: Nguyen, Minh-Loi, et autres
Publié: (2025)
CamoFA: A Learnable Fourier-based Augmentation for Camouflage Segmentation
par: Le, Minh-Quan, et autres
Publié: (2023)
par: Le, Minh-Quan, et autres
Publié: (2023)
Efficient 3D Brain Tumor Segmentation with Axial-Coronal-Sagittal Embedding
par: Huynh, Tuan-Luc, et autres
Publié: (2025)
par: Huynh, Tuan-Luc, et autres
Publié: (2025)
Automated Image Recognition Framework
par: Nguyen, Quang-Binh, et autres
Publié: (2025)
par: Nguyen, Quang-Binh, et autres
Publié: (2025)
DiFlowDubber: Discrete Flow Matching for Automated Video Dubbing via Cross-Modal Alignment and Synchronization
par: Nguyen, Ngoc-Son, et autres
Publié: (2026)
par: Nguyen, Ngoc-Son, et autres
Publié: (2026)
Diffusion Model in Latent Space for Medical Image Segmentation Task
par: Ngoc, Huynh Trinh, et autres
Publié: (2025)
par: Ngoc, Huynh Trinh, et autres
Publié: (2025)
PrefPaint: Enhancing Medical Image Inpainting through Expert Human Feedback
par: Bui, Duy-Bao, et autres
Publié: (2025)
par: Bui, Duy-Bao, et autres
Publié: (2025)
TrafficVLM: A Controllable Visual Language Model for Traffic Video Captioning
par: Dinh, Quang Minh, et autres
Publié: (2024)
par: Dinh, Quang Minh, et autres
Publié: (2024)
Weather-Robust Cross-View Geo-Localization via Prototype-Based Semantic Part Discovery
par: Tran, Chi-Nguyen, et autres
Publié: (2026)
par: Tran, Chi-Nguyen, et autres
Publié: (2026)
MaskDiff: Modeling Mask Distribution with Diffusion Probabilistic Model for Few-Shot Instance Segmentation
par: Le, Minh-Quan, et autres
Publié: (2023)
par: Le, Minh-Quan, et autres
Publié: (2023)
ThyroidEffi 1.0: A Cost-Effective System for High-Performance Multi-Class Thyroid Carcinoma Classification
par: Pham-Ngoc, Hai, et autres
Publié: (2025)
par: Pham-Ngoc, Hai, et autres
Publié: (2025)
GenKOL: Modular Generative AI Framework For Scalable Virtual KOL Generation
par: To, Tan-Hiep, et autres
Publié: (2025)
par: To, Tan-Hiep, et autres
Publié: (2025)
FaR: Enhancing Multi-Concept Text-to-Image Diffusion via Concept Fusion and Localized Refinement
par: Tran, Gia-Nghia, et autres
Publié: (2025)
par: Tran, Gia-Nghia, et autres
Publié: (2025)
SimGraph: A Unified Framework for Scene Graph-Based Image Generation and Editing
par: Vo, Thanh-Nhan, et autres
Publié: (2026)
par: Vo, Thanh-Nhan, et autres
Publié: (2026)
PANDORA: Pixel-wise Attention Dissolution and Latent Guidance for Zero-Shot Object Removal
par: Vo, Dinh-Khoi, et autres
Publié: (2026)
par: Vo, Dinh-Khoi, et autres
Publié: (2026)
KiseKloset for Fashion Retrieval and Recommendation
par: Phan-Nguyen, Thanh-Tung, et autres
Publié: (2025)
par: Phan-Nguyen, Thanh-Tung, et autres
Publié: (2025)
MambaU-Lite: A Lightweight Model based on Mamba and Integrated Channel-Spatial Attention for Skin Lesion Segmentation
par: Nguyen, Thi-Nhu-Quynh, et autres
Publié: (2024)
par: Nguyen, Thi-Nhu-Quynh, et autres
Publié: (2024)
UR-JEPA: Uniform Rectifiability as a Regularizer for Joint-Embedding Predictive Architectures
par: Le, Triet M.
Publié: (2026)
par: Le, Triet M.
Publié: (2026)
SADL: An Effective In-Context Learning Method for Compositional Visual QA
par: Dang, Long Hoang, et autres
Publié: (2024)
par: Dang, Long Hoang, et autres
Publié: (2024)
Lightweight Models for Emotional Analysis in Video
par: Nguyen, Quoc-Tien, et autres
Publié: (2025)
par: Nguyen, Quoc-Tien, et autres
Publié: (2025)
STER-VLM: Spatio-Temporal With Enhanced Reference Vision-Language Models
par: Nguyen-Nhu, Tinh-Anh, et autres
Publié: (2025)
par: Nguyen-Nhu, Tinh-Anh, et autres
Publié: (2025)
Federated Prompt-Tuning with Heterogeneous and Incomplete Multimodal Client Data
par: Phung, Thu Hang, et autres
Publié: (2026)
par: Phung, Thu Hang, et autres
Publié: (2026)
OpenEvents V1: Large-Scale Benchmark Dataset for Multimodal Event Grounding
par: Nguyen, Hieu, et autres
Publié: (2025)
par: Nguyen, Hieu, et autres
Publié: (2025)
Shape2Animal: Creative Animal Generation from Natural Silhouettes
par: Tran, Quoc-Duy, et autres
Publié: (2025)
par: Tran, Quoc-Duy, et autres
Publié: (2025)
Documents similaires
-
Cluster-based Video Summarization with Temporal Context Awareness
par: Huynh-Lam, Hai-Dang, et autres
Publié: (2024) -
MasHeNe: A Benchmark for Head and Neck CT Mass Segmentation using Window-Enhanced Mamba with Frequency-Domain Integration
par: Dao, Thao Thi Phuong, et autres
Publié: (2025) -
Interactive Interface For Semantic Segmentation Dataset Synthesis
par: Tran, Ngoc-Do, et autres
Publié: (2025) -
GenFlow: Interactive Modular System for Image Generation
par: Nguyen, Duc-Hung, et autres
Publié: (2025) -
SAMURAI: Shape-Aware Multimodal Retrieval for 3D Object Identification
par: Vo, Dinh-Khoi, et autres
Publié: (2025)