Bidirectional Likelihood Estimation with Multi-Modal Large Language Models for Text-Video Retrieval
Fuente:
arXiv
Salvato in:
| Autori principali: | Ko, Dohwan, Lee, Ji Soo, Choi, Minhyuk, Meng, Zihang, Kim, Hyunwoo J. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MoE-GRPO: Optimizing Mixture-of-Experts via Reinforcement Learning in Vision-Language Models
di: Ko, Dohwan, et al.
Pubblicazione: (2026)
di: Ko, Dohwan, et al.
Pubblicazione: (2026)
Captioning for Text-Video Retrieval via Dual-Group Direct Preference Optimization
di: Lee, Ji Soo, et al.
Pubblicazione: (2025)
di: Lee, Ji Soo, et al.
Pubblicazione: (2025)
vid-TLDR: Training Free Token merging for Light-weight Video Transformer
di: Choi, Joonmyung, et al.
Pubblicazione: (2024)
di: Choi, Joonmyung, et al.
Pubblicazione: (2024)
DocPrune:Efficient Document Question Answering via Background, Question, and Comprehension-aware Token Pruning
di: Choi, Joonmyung, et al.
Pubblicazione: (2026)
di: Choi, Joonmyung, et al.
Pubblicazione: (2026)
Efficient multi-view training for 3D Gaussian Splatting
di: Choi, Minhyuk, et al.
Pubblicazione: (2025)
di: Choi, Minhyuk, et al.
Pubblicazione: (2025)
ST-VLM: Kinematic Instruction Tuning for Spatio-Temporal Reasoning in Vision-Language Models
di: Ko, Dohwan, et al.
Pubblicazione: (2025)
di: Ko, Dohwan, et al.
Pubblicazione: (2025)
What Users Leave Unsaid: Under-Specified Queries Limit Vision-Language Models
di: Choi, Dasol, et al.
Pubblicazione: (2026)
di: Choi, Dasol, et al.
Pubblicazione: (2026)
VidChain: Chain-of-Tasks with Metric-based Direct Preference Optimization for Dense Video Captioning
di: Lee, Ji Soo, et al.
Pubblicazione: (2025)
di: Lee, Ji Soo, et al.
Pubblicazione: (2025)
Bridging Vision and Language: Modeling Causality and Temporality in Video Narratives
di: Park, Ji-jun, et al.
Pubblicazione: (2024)
di: Park, Ji-jun, et al.
Pubblicazione: (2024)
Retrieve What's Missing: Coverage-Maximizing Retrieval for Consistent Long Video Generation
di: Joo, Minseok, et al.
Pubblicazione: (2026)
di: Joo, Minseok, et al.
Pubblicazione: (2026)
Follow the Saliency: Supervised Saliency for Retrieval-augmented Dense Video Captioning
di: Choi, Seung hee, et al.
Pubblicazione: (2026)
di: Choi, Seung hee, et al.
Pubblicazione: (2026)
Multi-criteria Token Fusion with One-step-ahead Attention for Efficient Vision Transformers
di: Lee, Sanghyeok, et al.
Pubblicazione: (2024)
di: Lee, Sanghyeok, et al.
Pubblicazione: (2024)
Visual Delta Generator with Large Multi-modal Models for Semi-supervised Composed Image Retrieval
di: Jang, Young Kyun, et al.
Pubblicazione: (2024)
di: Jang, Young Kyun, et al.
Pubblicazione: (2024)
Relevance-aware Multi-context Contrastive Decoding for Retrieval-augmented Visual Question Answering
di: Kim, Jongha, et al.
Pubblicazione: (2026)
di: Kim, Jongha, et al.
Pubblicazione: (2026)
Training-Free Dense Hand Contact Estimation with Multi-Modal Large Language Models
di: Jung, Daniel Sungho, et al.
Pubblicazione: (2026)
di: Jung, Daniel Sungho, et al.
Pubblicazione: (2026)
Do You Remember? Dense Video Captioning with Cross-Modal Memory Retrieval
di: Kim, Minkuk, et al.
Pubblicazione: (2024)
di: Kim, Minkuk, et al.
Pubblicazione: (2024)
TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval
di: Zhao, Zixu, et al.
Pubblicazione: (2025)
di: Zhao, Zixu, et al.
Pubblicazione: (2025)
Reasoning Text-to-Video Retrieval via Digital Twin Video Representations and Large Language Models
di: Shen, Yiqing, et al.
Pubblicazione: (2025)
di: Shen, Yiqing, et al.
Pubblicazione: (2025)
MultiVerse: A Multi-Turn Conversation Benchmark for Evaluating Large Vision and Language Models
di: Lee, Young-Jun, et al.
Pubblicazione: (2025)
di: Lee, Young-Jun, et al.
Pubblicazione: (2025)
Representation Shift: Unifying Token Compression with FlashAttention
di: Choi, Joonmyung, et al.
Pubblicazione: (2025)
di: Choi, Joonmyung, et al.
Pubblicazione: (2025)
Slow-Fast Architecture for Video Multi-Modal Large Language Models
di: Shi, Min, et al.
Pubblicazione: (2025)
di: Shi, Min, et al.
Pubblicazione: (2025)
UDC-VIT: A Real-World Video Dataset for Under-Display Cameras
di: Ahn, Kyusu, et al.
Pubblicazione: (2025)
di: Ahn, Kyusu, et al.
Pubblicazione: (2025)
Text-Video Retrieval via Variational Multi-Modal Hypergraph Networks
di: Li, Qian, et al.
Pubblicazione: (2024)
di: Li, Qian, et al.
Pubblicazione: (2024)
Coherent Human-Scene Reconstruction from Multi-Person Multi-View Video in a Single Pass
di: Kim, Sangmin, et al.
Pubblicazione: (2026)
di: Kim, Sangmin, et al.
Pubblicazione: (2026)
Proxy-Free Gaussian Splats Deformation with Splat-Based Surface Estimation
di: Kim, Jaeyeong, et al.
Pubblicazione: (2025)
di: Kim, Jaeyeong, et al.
Pubblicazione: (2025)
Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval
di: Fang, Xiang, et al.
Pubblicazione: (2026)
di: Fang, Xiang, et al.
Pubblicazione: (2026)
Fine Tuning Text-to-Image Diffusion Models for Correcting Anomalous Images
di: Yoo, Hyunwoo
Pubblicazione: (2024)
di: Yoo, Hyunwoo
Pubblicazione: (2024)
Probabilistic Vision-Language Representation for Weakly Supervised Temporal Action Localization
di: Lim, Geuntaek, et al.
Pubblicazione: (2024)
di: Lim, Geuntaek, et al.
Pubblicazione: (2024)
EfficientViM: Efficient Vision Mamba with Hidden State Mixer based State Space Duality
di: Lee, Sanghyeok, et al.
Pubblicazione: (2024)
di: Lee, Sanghyeok, et al.
Pubblicazione: (2024)
Can Language Models Laugh at YouTube Short-form Videos?
di: Ko, Dayoon, et al.
Pubblicazione: (2023)
di: Ko, Dayoon, et al.
Pubblicazione: (2023)
MEVG: Multi-event Video Generation with Text-to-Video Models
di: Oh, Gyeongrok, et al.
Pubblicazione: (2023)
di: Oh, Gyeongrok, et al.
Pubblicazione: (2023)
Bridging the Missing-Modality Gap: Improving Text-Only Calibration of Vision Language Models
di: Kim, Mingyeong, et al.
Pubblicazione: (2026)
di: Kim, Mingyeong, et al.
Pubblicazione: (2026)
Event-Based Video Frame Interpolation With Cross-Modal Asymmetric Bidirectional Motion Fields
di: Kim, Taewoo, et al.
Pubblicazione: (2025)
di: Kim, Taewoo, et al.
Pubblicazione: (2025)
Robust Multimodal 3D Object Detection via Modality-Agnostic Decoding and Proximity-based Modality Ensemble
di: Cha, Juhan, et al.
Pubblicazione: (2024)
di: Cha, Juhan, et al.
Pubblicazione: (2024)
ReCo: Reminder Composition Mitigates Hallucinations in Vision-Language Models
di: Chytas, Sotirios Panagiotis, et al.
Pubblicazione: (2025)
di: Chytas, Sotirios Panagiotis, et al.
Pubblicazione: (2025)
Intriguing Properties of Large Language and Vision Models
di: Lee, Young-Jun, et al.
Pubblicazione: (2024)
di: Lee, Young-Jun, et al.
Pubblicazione: (2024)
Prompt Learning via Meta-Regularization
di: Park, Jinyoung, et al.
Pubblicazione: (2024)
di: Park, Jinyoung, et al.
Pubblicazione: (2024)
Stochastic Conditional Diffusion Models for Robust Semantic Image Synthesis
di: Ko, Juyeon, et al.
Pubblicazione: (2024)
di: Ko, Juyeon, et al.
Pubblicazione: (2024)
JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts
di: Son, Taein, et al.
Pubblicazione: (2024)
di: Son, Taein, et al.
Pubblicazione: (2024)
ORIGEN: Zero-Shot 3D Orientation Grounding in Text-to-Image Generation
di: Min, Yunhong, et al.
Pubblicazione: (2025)
di: Min, Yunhong, et al.
Pubblicazione: (2025)
Documenti analoghi
-
MoE-GRPO: Optimizing Mixture-of-Experts via Reinforcement Learning in Vision-Language Models
di: Ko, Dohwan, et al.
Pubblicazione: (2026) -
Captioning for Text-Video Retrieval via Dual-Group Direct Preference Optimization
di: Lee, Ji Soo, et al.
Pubblicazione: (2025) -
vid-TLDR: Training Free Token merging for Light-weight Video Transformer
di: Choi, Joonmyung, et al.
Pubblicazione: (2024) -
DocPrune:Efficient Document Question Answering via Background, Question, and Comprehension-aware Token Pruning
di: Choi, Joonmyung, et al.
Pubblicazione: (2026) -
Efficient multi-view training for 3D Gaussian Splatting
di: Choi, Minhyuk, et al.
Pubblicazione: (2025)