Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tu, Yunbin, Li, Liang, Su, Li, Huang, Qingming |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Distractors-Immune Representation Learning with Cross-modal Contrastive Regularization for Change Captioning
par: Tu, Yunbin, et autres
Publié: (2024)
par: Tu, Yunbin, et autres
Publié: (2024)
Context-aware Difference Distilling for Multi-change Captioning
par: Tu, Yunbin, et autres
Publié: (2024)
par: Tu, Yunbin, et autres
Publié: (2024)
Text-only Synthesis for Image Captioning
par: Zhou, Qing, et autres
Publié: (2024)
par: Zhou, Qing, et autres
Publié: (2024)
Towards Retrieval-Augmented Architectures for Image Captioning
par: Sarto, Sara, et autres
Publié: (2024)
par: Sarto, Sara, et autres
Publié: (2024)
From Pixels to Posts: Retrieval-Augmented Fashion Captioning and Hashtag Generation
par: Gondal, Moazzam Umer, et autres
Publié: (2025)
par: Gondal, Moazzam Umer, et autres
Publié: (2025)
FigEx2: Visual-Conditioned Panel Detection and Captioning for Scientific Compound Figures
par: Song, Jifeng, et autres
Publié: (2026)
par: Song, Jifeng, et autres
Publié: (2026)
ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning
par: Kim, Taewhan, et autres
Publié: (2024)
par: Kim, Taewhan, et autres
Publié: (2024)
Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval
par: Shen, Li-Cheng, et autres
Publié: (2025)
par: Shen, Li-Cheng, et autres
Publié: (2025)
UI-Vision: A Desktop-centric GUI Benchmark for Visual Perception and Interaction
par: Nayak, Shravan, et autres
Publié: (2025)
par: Nayak, Shravan, et autres
Publié: (2025)
CapGeo: A Caption-Assisted Approach to Geometric Reasoning
par: Li, Yuying, et autres
Publié: (2025)
par: Li, Yuying, et autres
Publié: (2025)
VoCoT: Unleashing Visually Grounded Multi-Step Reasoning in Large Multi-Modal Models
par: Li, Zejun, et autres
Publié: (2024)
par: Li, Zejun, et autres
Publié: (2024)
VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning
par: Lu, Xingyu, et autres
Publié: (2026)
par: Lu, Xingyu, et autres
Publié: (2026)
LAViTeR: Learning Aligned Visual and Textual Representations Assisted by Image and Caption Generation
par: Hashemi, Mohammad Abuzar, et autres
Publié: (2021)
par: Hashemi, Mohammad Abuzar, et autres
Publié: (2021)
The Role of Data Curation in Image Captioning
par: Li, Wenyan, et autres
Publié: (2023)
par: Li, Wenyan, et autres
Publié: (2023)
Region-R1: Reinforcing Query-Side Region Cropping for Multi-Modal Re-Ranking
par: Hu, Chan-Wei, et autres
Publié: (2026)
par: Hu, Chan-Wei, et autres
Publié: (2026)
A Survey of Multimodal Large Language Model from A Data-centric Perspective
par: Bai, Tianyi, et autres
Publié: (2024)
par: Bai, Tianyi, et autres
Publié: (2024)
Unsupervised Memorability Modeling from Tip-of-the-Tongue Retrieval Queries
par: Bhattacharyya, Sree, et autres
Publié: (2025)
par: Bhattacharyya, Sree, et autres
Publié: (2025)
QA-Dragon: Query-Aware Dynamic RAG System for Knowledge-Intensive Visual Question Answering
par: Jiang, Zhuohang, et autres
Publié: (2025)
par: Jiang, Zhuohang, et autres
Publié: (2025)
CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning
par: Li, Kailing, et autres
Publié: (2025)
par: Li, Kailing, et autres
Publié: (2025)
CapRL: Stimulating Dense Image Caption Capabilities via Reinforcement Learning
par: Xing, Long, et autres
Publié: (2025)
par: Xing, Long, et autres
Publié: (2025)
Stepping Stones: A Progressive Training Strategy for Audio-Visual Semantic Segmentation
par: Ma, Juncheng, et autres
Publié: (2024)
par: Ma, Juncheng, et autres
Publié: (2024)
MVMR: A New Framework for Evaluating Faithfulness of Video Moment Retrieval against Multiple Distractors
par: Yang, Nakyeong, et autres
Publié: (2023)
par: Yang, Nakyeong, et autres
Publié: (2023)
SMART: Shot-Aware Multimodal Video Moment Retrieval with Audio-Enhanced MLLM
par: Yu, An, et autres
Publié: (2025)
par: Yu, An, et autres
Publié: (2025)
Retrieval-Augmented Long-Context Translation for Cultural Image Captioning: Gators submission for AmericasNLP 2026 shared task
par: Dhawan, Aashish, et autres
Publié: (2026)
par: Dhawan, Aashish, et autres
Publié: (2026)
HNC: Leveraging Hard Negative Captions towards Models with Fine-Grained Visual-Linguistic Comprehension Capabilities
par: Dönmez, Esra, et autres
Publié: (2026)
par: Dönmez, Esra, et autres
Publié: (2026)
Audio-centric Video Understanding Benchmark without Text Shortcut
par: Yang, Yudong, et autres
Publié: (2025)
par: Yang, Yudong, et autres
Publié: (2025)
BRIDGE: Bridging Gaps in Image Captioning Evaluation with Stronger Visual Cues
par: Sarto, Sara, et autres
Publié: (2024)
par: Sarto, Sara, et autres
Publié: (2024)
Unveiling the Invisible: Captioning Videos with Metaphors
par: Kalarani, Abisek Rajakumar, et autres
Publié: (2024)
par: Kalarani, Abisek Rajakumar, et autres
Publié: (2024)
Retrieving Counterfactuals Improves Visual In-Context Learning
par: Xiong, Guangzhi, et autres
Publié: (2026)
par: Xiong, Guangzhi, et autres
Publié: (2026)
Can We Generate Images with CoT? Let's Verify and Reinforce Image Generation Step by Step
par: Guo, Ziyu, et autres
Publié: (2025)
par: Guo, Ziyu, et autres
Publié: (2025)
WsiCaption: Multiple Instance Generation of Pathology Reports for Gigapixel Whole-Slide Images
par: Chen, Pingyi, et autres
Publié: (2023)
par: Chen, Pingyi, et autres
Publié: (2023)
ChestX-Reasoner: Advancing Radiology Foundation Models with Reasoning through Step-by-Step Verification
par: Fan, Ziqing, et autres
Publié: (2025)
par: Fan, Ziqing, et autres
Publié: (2025)
Daily-Omni: Towards Audio-Visual Reasoning with Temporal Alignment across Modalities
par: Zhou, Ziwei, et autres
Publié: (2025)
par: Zhou, Ziwei, et autres
Publié: (2025)
Updating CLIP to Prefer Descriptions Over Captions
par: Zur, Amir, et autres
Publié: (2024)
par: Zur, Amir, et autres
Publié: (2024)
Do Large Multimodal Models Solve Caption Generation for Scientific Figures? Lessons Learned from SciCap Challenge 2023
par: Hsu, Ting-Yao E., et autres
Publié: (2025)
par: Hsu, Ting-Yao E., et autres
Publié: (2025)
AdaCodec: A Predictive Visual Code for Video MLLMs
par: Hou, Haowen, et autres
Publié: (2026)
par: Hou, Haowen, et autres
Publié: (2026)
CAPEEN: Image Captioning with Early Exits and Knowledge Distillation
par: Bajpai, Divya Jyoti, et autres
Publié: (2024)
par: Bajpai, Divya Jyoti, et autres
Publié: (2024)
ChartCap: Mitigating Hallucination of Dense Chart Captioning
par: Lim, Junyoung, et autres
Publié: (2025)
par: Lim, Junyoung, et autres
Publié: (2025)
CIC: A Framework for Culturally-Aware Image Captioning
par: Yun, Youngsik, et autres
Publié: (2024)
par: Yun, Youngsik, et autres
Publié: (2024)
LaMP-Cap: Personalized Figure Caption Generation With Multimodal Figure Profiles
par: Ng, Ho Yin 'Sam', et autres
Publié: (2025)
par: Ng, Ho Yin 'Sam', et autres
Publié: (2025)
Documents similaires
-
Distractors-Immune Representation Learning with Cross-modal Contrastive Regularization for Change Captioning
par: Tu, Yunbin, et autres
Publié: (2024) -
Context-aware Difference Distilling for Multi-change Captioning
par: Tu, Yunbin, et autres
Publié: (2024) -
Text-only Synthesis for Image Captioning
par: Zhou, Qing, et autres
Publié: (2024) -
Towards Retrieval-Augmented Architectures for Image Captioning
par: Sarto, Sara, et autres
Publié: (2024) -
From Pixels to Posts: Retrieval-Augmented Fashion Captioning and Hashtag Generation
par: Gondal, Moazzam Umer, et autres
Publié: (2025)