Video-Language Understanding: A Survey from Model Architecture, Model Training, and Data Perspectives
Fuente:
arXiv
Guardado en:
| Autores principales: | Nguyen, Thong, Bin, Yi, Xiao, Junbin, Qu, Leigang, Li, Yicong, Wu, Jay Zhangjie, Nguyen, Cong-Duy, Ng, See-Kiong, Tuan, Luu Anh |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Temporal-Oriented Recipe for Transferring Large Vision-Language Model to Video Understanding
por: Nguyen, Thong, et al.
Publicado: (2025)
por: Nguyen, Thong, et al.
Publicado: (2025)
Vision-and-Language Pretraining
por: Nguyen, Thong, et al.
Publicado: (2022)
por: Nguyen, Thong, et al.
Publicado: (2022)
Topic Modeling as Multi-Objective Contrastive Optimization
por: Nguyen, Thong, et al.
Publicado: (2024)
por: Nguyen, Thong, et al.
Publicado: (2024)
DemaFormer: Damped Exponential Moving Average Transformer with Energy-Based Modeling for Temporal Language Grounding
por: Nguyen, Thong, et al.
Publicado: (2023)
por: Nguyen, Thong, et al.
Publicado: (2023)
Encoding and Controlling Global Semantics for Long-form Video Question Answering
por: Nguyen, Thong Thanh, et al.
Publicado: (2024)
por: Nguyen, Thong Thanh, et al.
Publicado: (2024)
Multi-Scale Contrastive Learning for Video Temporal Grounding
por: Nguyen, Thong Thanh, et al.
Publicado: (2024)
por: Nguyen, Thong Thanh, et al.
Publicado: (2024)
Motion-aware Contrastive Learning for Temporal Panoptic Scene Graph Generation
por: Nguyen, Thong Thanh, et al.
Publicado: (2024)
por: Nguyen, Thong Thanh, et al.
Publicado: (2024)
READ: Recurrent Adapter with Partial Video-Language Alignment for Parameter-Efficient Transfer Learning in Low-Resource Video-Language Modeling
por: Nguyen, Thong, et al.
Publicado: (2023)
por: Nguyen, Thong, et al.
Publicado: (2023)
When In-Distribution Gains Fail: Evaluating Weak-to-Strong Reward Models under Preference Shift
por: Le, Khoi, et al.
Publicado: (2026)
por: Le, Khoi, et al.
Publicado: (2026)
MAMA: Meta-optimized Angular Margin Contrastive Framework for Video-Language Representation Learning
por: Nguyen, Thong, et al.
Publicado: (2024)
por: Nguyen, Thong, et al.
Publicado: (2024)
Tracking the Truth: Object-Centric Spatio-Temporal Monitoring for Video Large Language Models
por: Cao, Tri, et al.
Publicado: (2026)
por: Cao, Tri, et al.
Publicado: (2026)
A Survey on Neural Topic Models: Methods, Applications, and Challenges
por: Wu, Xiaobao, et al.
Publicado: (2024)
por: Wu, Xiaobao, et al.
Publicado: (2024)
Don't Read Everything: A Curvature-Conditioned Query for Linear Attention
por: Le, Dong, et al.
Publicado: (2026)
por: Le, Dong, et al.
Publicado: (2026)
KDMCSE: Knowledge Distillation Multimodal Sentence Embeddings with Adaptive Angular margin Contrastive Learning
por: Nguyen, Cong-Duy, et al.
Publicado: (2024)
por: Nguyen, Cong-Duy, et al.
Publicado: (2024)
More Bias, Less Bias: BiasPrompting for Enhanced Multiple-Choice Question Answering
por: Vu, Duc Anh, et al.
Publicado: (2025)
por: Vu, Duc Anh, et al.
Publicado: (2025)
Expand BERT Representation with Visual Information via Grounded Language Learning with Multimodal Partial Alignment
por: Nguyen, Cong-Duy, et al.
Publicado: (2023)
por: Nguyen, Cong-Duy, et al.
Publicado: (2023)
Mercury: A Code Efficiency Benchmark for Code Large Language Models
por: Du, Mingzhe, et al.
Publicado: (2024)
por: Du, Mingzhe, et al.
Publicado: (2024)
On the Affinity, Rationality, and Diversity of Hierarchical Topic Modeling
por: Wu, Xiaobao, et al.
Publicado: (2024)
por: Wu, Xiaobao, et al.
Publicado: (2024)
CutPaste&Find: Efficient Multimodal Hallucination Detector with Visual-aid Knowledge Base
por: Nguyen, Cong-Duy, et al.
Publicado: (2025)
por: Nguyen, Cong-Duy, et al.
Publicado: (2025)
Gradient-Boosted Decision Tree for Listwise Context Model in Multimodal Review Helpfulness Prediction
por: Nguyen, Thong, et al.
Publicado: (2023)
por: Nguyen, Thong, et al.
Publicado: (2023)
Adaptive Contrastive Learning on Multimodal Transformer for Review Helpfulness Predictions
por: Nguyen, Thong, et al.
Publicado: (2022)
por: Nguyen, Thong, et al.
Publicado: (2022)
Learning Uncertainty from Sequential Internal Dispersion in Large Language Models
por: Srey, Ponhvoan, et al.
Publicado: (2026)
por: Srey, Ponhvoan, et al.
Publicado: (2026)
SemRoDe: Macro Adversarial Training to Learn Representations That are Robust to Word-Level Attacks
por: Formento, Brian, et al.
Publicado: (2024)
por: Formento, Brian, et al.
Publicado: (2024)
Enhancing Multimodal Entity Linking with Jaccard Distance-based Conditional Contrastive Learning and Contextual Visual Augmentation
por: Nguyen, Cong-Duy, et al.
Publicado: (2025)
por: Nguyen, Cong-Duy, et al.
Publicado: (2025)
InfoCTM: A Mutual Information Maximization Perspective of Cross-Lingual Topic Modeling
por: Wu, Xiaobao, et al.
Publicado: (2023)
por: Wu, Xiaobao, et al.
Publicado: (2023)
Enriching and Controlling Global Semantics for Text Summarization
por: Nguyen, Thong, et al.
Publicado: (2021)
por: Nguyen, Thong, et al.
Publicado: (2021)
Modeling Dynamic Topics in Chain-Free Fashion by Evolution-Tracking Contrastive Learning and Unassociated Word Exclusion
por: Wu, Xiaobao, et al.
Publicado: (2024)
por: Wu, Xiaobao, et al.
Publicado: (2024)
Curriculum Demonstration Selection for In-Context Learning
por: Vu, Duc Anh, et al.
Publicado: (2024)
por: Vu, Duc Anh, et al.
Publicado: (2024)
A Comparative Analysis of Contextual Representation Flow in State-Space and Transformer Architectures
por: Hoang, Nhat M., et al.
Publicado: (2025)
por: Hoang, Nhat M., et al.
Publicado: (2025)
Video Understanding: Through A Temporal Lens
por: Nguyen, Thong Thanh
Publicado: (2026)
por: Nguyen, Thong Thanh
Publicado: (2026)
FASTopic: Pretrained Transformer is a Fast, Adaptive, Stable, and Transferable Topic Model
por: Wu, Xiaobao, et al.
Publicado: (2024)
por: Wu, Xiaobao, et al.
Publicado: (2024)
Paper Espresso: From Paper Overload to Research Insight
por: Du, Mingzhe, et al.
Publicado: (2026)
por: Du, Mingzhe, et al.
Publicado: (2026)
CodeArena: A Collective Evaluation Platform for LLM Code Generation
por: Du, Mingzhe, et al.
Publicado: (2025)
por: Du, Mingzhe, et al.
Publicado: (2025)
Modeling‐Facilitated Field Survey Discovers of a New Population of the Annamite Striped Rabbit in Kon Tum Province, Vietnam
por: Anh Tuan Nguyen, et al.
Publicado: (2024)
por: Anh Tuan Nguyen, et al.
Publicado: (2024)
Guiding VLM Agents with Process Rewards at Inference Time for GUI Navigation
por: Hu, Zhiyuan, et al.
Publicado: (2025)
por: Hu, Zhiyuan, et al.
Publicado: (2025)
Uncertainty of Thoughts: Uncertainty-Aware Planning Enhances Information Seeking in Large Language Models
por: Hu, Zhiyuan, et al.
Publicado: (2024)
por: Hu, Zhiyuan, et al.
Publicado: (2024)
Distributional Surgery for Language Model Activations
por: Nguyen, Bao, et al.
Publicado: (2025)
por: Nguyen, Bao, et al.
Publicado: (2025)
Causality Model for Semantic Understanding on Videos
por: Yicong, Li
Publicado: (2025)
por: Yicong, Li
Publicado: (2025)
HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding
por: Zhang, Haowei, et al.
Publicado: (2026)
por: Zhang, Haowei, et al.
Publicado: (2026)
Towards Reliable Truth-Aligned Uncertainty Estimation in Large Language Models
por: Srey, Ponhvoan, et al.
Publicado: (2026)
por: Srey, Ponhvoan, et al.
Publicado: (2026)
Ejemplares similares
-
Temporal-Oriented Recipe for Transferring Large Vision-Language Model to Video Understanding
por: Nguyen, Thong, et al.
Publicado: (2025) -
Vision-and-Language Pretraining
por: Nguyen, Thong, et al.
Publicado: (2022) -
Topic Modeling as Multi-Objective Contrastive Optimization
por: Nguyen, Thong, et al.
Publicado: (2024) -
DemaFormer: Damped Exponential Moving Average Transformer with Energy-Based Modeling for Temporal Language Grounding
por: Nguyen, Thong, et al.
Publicado: (2023) -
Encoding and Controlling Global Semantics for Long-form Video Question Answering
por: Nguyen, Thong Thanh, et al.
Publicado: (2024)