Hybrid-Tower: Fine-grained Pseudo-query Interaction and Generation for Text-to-Video Retrieval
Fuente:
arXiv
Salvato in:
| Autori principali: | Lan, Bangxiang, Xie, Ruobing, Zhao, Ruixiang, Sun, Xingwu, Kang, Zhanhui, Yang, Gang, Li, Xirong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Magnifier Prompt: Tackling Multimodal Hallucination via Extremely Simple Instructions
di: Fu, Yuhan, et al.
Pubblicazione: (2024)
di: Fu, Yuhan, et al.
Pubblicazione: (2024)
SAVE: Speech-Aware Video Representation Learning for Video-Text Retrieval
di: Zhao, Ruixiang, et al.
Pubblicazione: (2026)
di: Zhao, Ruixiang, et al.
Pubblicazione: (2026)
Mitigating Hallucination in Multimodal Large Language Model via Hallucination-targeted Direct Preference Optimization
di: Fu, Yuhan, et al.
Pubblicazione: (2024)
di: Fu, Yuhan, et al.
Pubblicazione: (2024)
Multi-Object Sketch Animation by Scene Decomposition and Motion Planning
di: Liu, Jingyu, et al.
Pubblicazione: (2025)
di: Liu, Jingyu, et al.
Pubblicazione: (2025)
PhD: A ChatGPT-Prompted Visual hallucination Evaluation Dataset
di: Liu, Jiazhen, et al.
Pubblicazione: (2024)
di: Liu, Jiazhen, et al.
Pubblicazione: (2024)
Enhancing Contrastive Learning Inspired by the Philosophy of "The Blind Men and the Elephant"
di: Zhang, Yudong, et al.
Pubblicazione: (2024)
di: Zhang, Yudong, et al.
Pubblicazione: (2024)
QAVA: Query-Agnostic Visual Attack to Large Vision-Language Models
di: Zhang, Yudong, et al.
Pubblicazione: (2025)
di: Zhang, Yudong, et al.
Pubblicazione: (2025)
Continuous Speech Tokenizer in Text To Speech
di: Li, Yixing, et al.
Pubblicazione: (2024)
di: Li, Yixing, et al.
Pubblicazione: (2024)
Exploring Forgetting in Large Language Model Pre-Training
di: Liao, Chonghua, et al.
Pubblicazione: (2024)
di: Liao, Chonghua, et al.
Pubblicazione: (2024)
Fighting Fire with Fire (F3): A Training-free and Efficient Visual Adversarial Example Purification Method in LVLMs
di: Zhang, Yudong, et al.
Pubblicazione: (2025)
di: Zhang, Yudong, et al.
Pubblicazione: (2025)
DHCP: Detecting Hallucinations by Cross-modal Attention Pattern in Large Vision-Language Models
di: Zhang, Yudong, et al.
Pubblicazione: (2024)
di: Zhang, Yudong, et al.
Pubblicazione: (2024)
The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason
di: Lv, Ang, et al.
Pubblicazione: (2025)
di: Lv, Ang, et al.
Pubblicazione: (2025)
The Elephant in the Room: Rethinking the Usage of Pre-trained Language Model in Sequential Recommendation
di: Qu, Zekai, et al.
Pubblicazione: (2024)
di: Qu, Zekai, et al.
Pubblicazione: (2024)
Language Models "Grok" to Copy
di: Lv, Ang, et al.
Pubblicazione: (2024)
di: Lv, Ang, et al.
Pubblicazione: (2024)
Beyond Coarse-Grained Matching in Video-Text Retrieval
di: Chen, Aozhu, et al.
Pubblicazione: (2024)
di: Chen, Aozhu, et al.
Pubblicazione: (2024)
OmniPro: A Comprehensive Benchmark for Omni-Proactive Streaming Video Understanding
di: Zhao, Ruixiang, et al.
Pubblicazione: (2026)
di: Zhao, Ruixiang, et al.
Pubblicazione: (2026)
PIP: Detecting Adversarial Examples in Large Vision-Language Models via Attention Patterns of Irrelevant Probe Questions
di: Zhang, Yudong, et al.
Pubblicazione: (2024)
di: Zhang, Yudong, et al.
Pubblicazione: (2024)
MSTAR: Box-free Multi-query Scene Text Retrieval with Attention Recycling
di: Yin, Liang, et al.
Pubblicazione: (2025)
di: Yin, Liang, et al.
Pubblicazione: (2025)
Lossless KV Cache Compression to 2%
di: Yang, Zhen, et al.
Pubblicazione: (2024)
di: Yang, Zhen, et al.
Pubblicazione: (2024)
Fundus-R1: Training a Fundus-Reading MLLM with Knowledge-Aware Reasoning on Public Data
di: Deng, Yuchuan, et al.
Pubblicazione: (2026)
di: Deng, Yuchuan, et al.
Pubblicazione: (2026)
ETVA: Evaluation of Text-to-Video Alignment via Fine-grained Question Generation and Answering
di: Guan, Kaisi, et al.
Pubblicazione: (2025)
di: Guan, Kaisi, et al.
Pubblicazione: (2025)
Co-Teaching for Unsupervised Domain Adaptation and Expansion
di: Lin, Hailan, et al.
Pubblicazione: (2022)
di: Lin, Hailan, et al.
Pubblicazione: (2022)
Towards Fine-grained Interactive Segmentation in Images and Videos
di: Yao, Yuan, et al.
Pubblicazione: (2025)
di: Yao, Yuan, et al.
Pubblicazione: (2025)
GVDIFF: Grounded Text-to-Video Generation with Diffusion Models
di: Dou, Huanzhang, et al.
Pubblicazione: (2024)
di: Dou, Huanzhang, et al.
Pubblicazione: (2024)
ADaFuSE: Adaptive Diffusion-generated Image and Text Fusion for Interactive Text-to-Image Retrieval
di: Zhang, Zhuocheng, et al.
Pubblicazione: (2026)
di: Zhang, Zhuocheng, et al.
Pubblicazione: (2026)
The Security Threat of Compressed Projectors in Large Vision-Language Models
di: Zhang, Yudong, et al.
Pubblicazione: (2025)
di: Zhang, Yudong, et al.
Pubblicazione: (2025)
Multi-Grained Patch Training for Efficient LLM-based Recommendation
di: Liao, Jiayi, et al.
Pubblicazione: (2025)
di: Liao, Jiayi, et al.
Pubblicazione: (2025)
Enhancing Fine-grained Object Detection in Aerial Images via Orthogonal Mapping
di: Zhu, Haoran, et al.
Pubblicazione: (2024)
di: Zhu, Haoran, et al.
Pubblicazione: (2024)
IDPro: Flexible Interactive Video Object Segmentation by ID-queried Concurrent Propagation
di: Li, Kexin, et al.
Pubblicazione: (2024)
di: Li, Kexin, et al.
Pubblicazione: (2024)
PRVR: Partially Relevant Video Retrieval
di: Chen, Xianke, et al.
Pubblicazione: (2022)
di: Chen, Xianke, et al.
Pubblicazione: (2022)
ASR-enhanced Multimodal Representation Learning for Cross-Domain Product Retrieval
di: Zhao, Ruixiang, et al.
Pubblicazione: (2024)
di: Zhao, Ruixiang, et al.
Pubblicazione: (2024)
Multi-modal Reference Learning for Fine-grained Text-to-Image Retrieval
di: Ma, Zehong, et al.
Pubblicazione: (2025)
di: Ma, Zehong, et al.
Pubblicazione: (2025)
T2VIndexer: A Generative Video Indexer for Efficient Text-Video Retrieval
di: Li, Yili, et al.
Pubblicazione: (2024)
di: Li, Yili, et al.
Pubblicazione: (2024)
FITA: Fine-grained Image-Text Aligner for Radiology Report Generation
di: Yang, Honglong, et al.
Pubblicazione: (2024)
di: Yang, Honglong, et al.
Pubblicazione: (2024)
MotionAgent: Fine-grained Controllable Video Generation via Motion Field Agent
di: Liao, Xinyao, et al.
Pubblicazione: (2025)
di: Liao, Xinyao, et al.
Pubblicazione: (2025)
Repeating Words for Video-Language Retrieval with Coarse-to-Fine Objectives
di: Zhao, Haoyu, et al.
Pubblicazione: (2025)
di: Zhao, Haoyu, et al.
Pubblicazione: (2025)
MHSA: A Lightweight Framework for Mitigating Hallucinations via Steered Attention in LVLMs
di: Ding, Wei, et al.
Pubblicazione: (2026)
di: Ding, Wei, et al.
Pubblicazione: (2026)
Negative Sampling in Recommendation: A Survey and Future Directions
di: Ma, Haokai, et al.
Pubblicazione: (2024)
di: Ma, Haokai, et al.
Pubblicazione: (2024)
More Expressive Attention with Negative Weights
di: Lv, Ang, et al.
Pubblicazione: (2024)
di: Lv, Ang, et al.
Pubblicazione: (2024)
Autonomy-of-Experts Models
di: Lv, Ang, et al.
Pubblicazione: (2025)
di: Lv, Ang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Magnifier Prompt: Tackling Multimodal Hallucination via Extremely Simple Instructions
di: Fu, Yuhan, et al.
Pubblicazione: (2024) -
SAVE: Speech-Aware Video Representation Learning for Video-Text Retrieval
di: Zhao, Ruixiang, et al.
Pubblicazione: (2026) -
Mitigating Hallucination in Multimodal Large Language Model via Hallucination-targeted Direct Preference Optimization
di: Fu, Yuhan, et al.
Pubblicazione: (2024) -
Multi-Object Sketch Animation by Scene Decomposition and Motion Planning
di: Liu, Jingyu, et al.
Pubblicazione: (2025) -
PhD: A ChatGPT-Prompted Visual hallucination Evaluation Dataset
di: Liu, Jiazhen, et al.
Pubblicazione: (2024)