LFS: Learnable Frame Selector for Event-Aware and Temporally Diverse Video Captioning
Fuente:
arXiv
Guardado en:
| Autores principales: | Chao, Lianying, Yin, Linfeng, Ren, Peiyu, Jiang, Yifan, Ren, Qiaoyu, Shan, Dingcheng, Pang, Jing-cheng, Wu, Sijie, Li, Xubin, Zhang, Kai, Chen, Xin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Multi-Modal LLM based Image Captioning in ICT: Bridging the Gap Between General and Industry Domain
por: Chao, Lianying, et al.
Publicado: (2026)
por: Chao, Lianying, et al.
Publicado: (2026)
Progress-Aware Video Frame Captioning
por: Xue, Zihui, et al.
Publicado: (2024)
por: Xue, Zihui, et al.
Publicado: (2024)
EasyRec: Simple yet Effective Language Models for Recommendation
por: Ren, Xubin, et al.
Publicado: (2024)
por: Ren, Xubin, et al.
Publicado: (2024)
LFS-Aware Surface Reconstruction from Unoriented 3D Point Clouds
por: Fu, Rao, et al.
Publicado: (2024)
por: Fu, Rao, et al.
Publicado: (2024)
VideoRAG: Retrieval-Augmented Generation with Extreme Long-Context Videos
por: Ren, Xubin, et al.
Publicado: (2025)
por: Ren, Xubin, et al.
Publicado: (2025)
XRec: Large Language Models for Explainable Recommendation
por: Ma, Qiyao, et al.
Publicado: (2024)
por: Ma, Qiyao, et al.
Publicado: (2024)
AMOSL: Adaptive Modality-wise Structure Learning in Multi-view Graph Neural Networks For Enhanced Unified Representation
por: Liang, Peiyu, et al.
Publicado: (2024)
por: Liang, Peiyu, et al.
Publicado: (2024)
Enhance Temporal Relations in Audio Captioning with Sound Event Detection
por: Xie, Zeyu, et al.
Publicado: (2023)
por: Xie, Zeyu, et al.
Publicado: (2023)
Disentangled Contrastive Collaborative Filtering
por: Ren, Xubin, et al.
Publicado: (2023)
por: Ren, Xubin, et al.
Publicado: (2023)
A Survey of Large Language Models for Graphs
por: Ren, Xubin, et al.
Publicado: (2024)
por: Ren, Xubin, et al.
Publicado: (2024)
Set Prediction Guided by Semantic Concepts for Diverse Video Captioning
por: Lu, Yifan, et al.
Publicado: (2023)
por: Lu, Yifan, et al.
Publicado: (2023)
Exploring Temporal Event Cues for Dense Video Captioning in Cyclic Co-learning
por: Xie, Zhuyang, et al.
Publicado: (2024)
por: Xie, Zhuyang, et al.
Publicado: (2024)
A Comprehensive Survey on Self-Supervised Learning for Recommendation
por: Ren, Xubin, et al.
Publicado: (2024)
por: Ren, Xubin, et al.
Publicado: (2024)
MiniRAG: Towards Extremely Simple Retrieval-Augmented Generation
por: Fan, Tianyu, et al.
Publicado: (2025)
por: Fan, Tianyu, et al.
Publicado: (2025)
Explicit Temporal-Semantic Modeling for Dense Video Captioning via Context-Aware Cross-Modal Interaction
por: Jia, Mingda, et al.
Publicado: (2025)
por: Jia, Mingda, et al.
Publicado: (2025)
VisionSelector: End-to-End Learnable Visual Token Compression for Efficient Multimodal LLMs
por: Zhu, Jiaying, et al.
Publicado: (2025)
por: Zhu, Jiaying, et al.
Publicado: (2025)
Harnessing Corporate Social Responsibility and Innovation Management: A Path Toward Diversity, Equity, and Inclusion Management Using Stakeholder Theory
por: Lianying Yao, et al.
Publicado: (2026)
por: Lianying Yao, et al.
Publicado: (2026)
Reinforcement Learning with Promising Tokens for Large Language Models
por: Pang, Jing-Cheng, et al.
Publicado: (2026)
por: Pang, Jing-Cheng, et al.
Publicado: (2026)
Zero-Shot Video Translation and Editing with Frame Spatial-Temporal Correspondence
por: Yang, Shuai, et al.
Publicado: (2025)
por: Yang, Shuai, et al.
Publicado: (2025)
Panoptic Captioning: An Equivalence Bridge for Image and Text
por: Lin, Kun-Yu, et al.
Publicado: (2025)
por: Lin, Kun-Yu, et al.
Publicado: (2025)
Frame-Level Captions for Long Video Generation with Complex Multi Scenes
por: Zheng, Guangcong, et al.
Publicado: (2025)
por: Zheng, Guangcong, et al.
Publicado: (2025)
RAG-Anything: All-in-One RAG Framework
por: Guo, Zirui, et al.
Publicado: (2025)
por: Guo, Zirui, et al.
Publicado: (2025)
DeepCode: Open Agentic Coding
por: Li, Zongwei, et al.
Publicado: (2025)
por: Li, Zongwei, et al.
Publicado: (2025)
CARES: Context-Aware Resolution Selector for VLMs
por: Kimhi, Moshe, et al.
Publicado: (2025)
por: Kimhi, Moshe, et al.
Publicado: (2025)
Event-Anchored Frame Selection for Effective Long-Video Understanding
por: Chen, Wang, et al.
Publicado: (2026)
por: Chen, Wang, et al.
Publicado: (2026)
Scene Summarization: Clustering Scene Videos into Spatially Diverse Frames
por: Chen, Chao, et al.
Publicado: (2023)
por: Chen, Chao, et al.
Publicado: (2023)
Towards Diverse and Efficient Audio Captioning via Diffusion Models
por: Xu, Manjie, et al.
Publicado: (2024)
por: Xu, Manjie, et al.
Publicado: (2024)
EventVAD: Training-Free Event-Aware Video Anomaly Detection
por: Shao, Yihua, et al.
Publicado: (2025)
por: Shao, Yihua, et al.
Publicado: (2025)
Modular matrix invariants under some transpose actions
por: Chen, Yin, et al.
Publicado: (2025)
por: Chen, Yin, et al.
Publicado: (2025)
V-CAST: Video Curvature-Aware Spatio-Temporal Pruning for Efficient Video Large Language Models
por: Lin, Xinying, et al.
Publicado: (2026)
por: Lin, Xinying, et al.
Publicado: (2026)
Narrating the Video: Boosting Text-Video Retrieval via Comprehensive Utilization of Frame-Level Captions
por: Hur, Chan, et al.
Publicado: (2025)
por: Hur, Chan, et al.
Publicado: (2025)
Diversity and Temporality of Chaotic Events
por: Javier Montenegro Joo
Publicado: (2016)
por: Javier Montenegro Joo
Publicado: (2016)
Video Summarization: Towards Entity-Aware Captions
por: Ayyubi, Hammad A., et al.
Publicado: (2023)
por: Ayyubi, Hammad A., et al.
Publicado: (2023)
Learnable Gated Temporal Shift Module for Deep Video Inpainting
por: Chang, Ya-Liang, et al.
Publicado: (2019)
por: Chang, Ya-Liang, et al.
Publicado: (2019)
Emodin promotes the recovery of rheumatoid arthritis by regulating the crosstalk between macrophage subsets and synovial fibroblast subsets
por: Lianying Cheng, et al.
Publicado: (2024)
por: Lianying Cheng, et al.
Publicado: (2024)
Effectiveness of an Enhanced Nursing Intervention Program Combining Infection Control and Respiratory Function Training in Patients With Leukemia and Respiratory Infections During Chemotherapy
por: Yuzhen Lu, et al.
Publicado: (2025)
por: Yuzhen Lu, et al.
Publicado: (2025)
TA-Prompting: Enhancing Video Large Language Models for Dense Video Captioning via Temporal Anchors
por: Cheng, Wei-Yuan, et al.
Publicado: (2026)
por: Cheng, Wei-Yuan, et al.
Publicado: (2026)
Carrier-Phonon Decoupling via Annealing Enhances Thermoelectric Performance of Bi2(Te,Se)
por: cheng, xinxiu, et al.
Publicado: (2025)
por: cheng, xinxiu, et al.
Publicado: (2025)
Invariant Link Selector for Spatial-Temporal Out-of-Distribution Problem
por: Tieu, Katherine, et al.
Publicado: (2025)
por: Tieu, Katherine, et al.
Publicado: (2025)
Sali4Vid: Saliency-Aware Video Reweighting and Adaptive Caption Retrieval for Dense Video Captioning
por: Jeon, MinJu, et al.
Publicado: (2025)
por: Jeon, MinJu, et al.
Publicado: (2025)
Ejemplares similares
-
Multi-Modal LLM based Image Captioning in ICT: Bridging the Gap Between General and Industry Domain
por: Chao, Lianying, et al.
Publicado: (2026) -
Progress-Aware Video Frame Captioning
por: Xue, Zihui, et al.
Publicado: (2024) -
EasyRec: Simple yet Effective Language Models for Recommendation
por: Ren, Xubin, et al.
Publicado: (2024) -
LFS-Aware Surface Reconstruction from Unoriented 3D Point Clouds
por: Fu, Rao, et al.
Publicado: (2024) -
VideoRAG: Retrieval-Augmented Generation with Extreme Long-Context Videos
por: Ren, Xubin, et al.
Publicado: (2025)