Set Prediction Guided by Semantic Concepts for Diverse Video Captioning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lu, Yifan, Zhang, Ziqi, Yuan, Chunfeng, Li, Peng, Wang, Yan, Li, Bing, Hu, Weiming |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Mitigating Hallucinations in Large Vision-Language Models by Self-Injecting Hallucinations
par: Lu, Yifan, et autres
Publié: (2025)
par: Lu, Yifan, et autres
Publié: (2025)
Beyond Semantic Search: Towards Referential Anchoring in Composed Image Retrieval
par: Yang, Yuxin, et autres
Publié: (2026)
par: Yang, Yuxin, et autres
Publié: (2026)
EA-VTR: Event-Aware Video-Text Retrieval
par: Ma, Zongyang, et autres
Publié: (2024)
par: Ma, Zongyang, et autres
Publié: (2024)
GMC-IQA: Exploiting Global-correlation and Mean-opinion Consistency for No-reference Image Quality Assessment
par: Chen, Zewen, et autres
Publié: (2024)
par: Chen, Zewen, et autres
Publié: (2024)
Semantics-enhanced Cross-modal Masked Image Modeling for Vision-Language Pre-training
par: Liu, Haowei, et autres
Publié: (2024)
par: Liu, Haowei, et autres
Publié: (2024)
Unifying Latent and Lexicon Representations for Effective Video-Text Retrieval
par: Liu, Haowei, et autres
Publié: (2024)
par: Liu, Haowei, et autres
Publié: (2024)
MMhops-R1: Multimodal Multi-hop Reasoning
par: Zhang, Tao, et autres
Publié: (2025)
par: Zhang, Tao, et autres
Publié: (2025)
PromptIQA: Boosting the Performance and Generalization for No-Reference Image Quality Assessment via Prompts
par: Chen, Zewen, et autres
Publié: (2024)
par: Chen, Zewen, et autres
Publié: (2024)
Making MLLMs Blind: Adversarial Smuggling Attacks in MLLM Content Moderation
par: Li, Zhiheng, et autres
Publié: (2026)
par: Li, Zhiheng, et autres
Publié: (2026)
How Far Is Document Parsing from Solved? PureDocBench: A Source-TraceableBenchmark across Clean, Degraded, and Real-World Settings
par: Li, Zhiheng, et autres
Publié: (2026)
par: Li, Zhiheng, et autres
Publié: (2026)
How to Make Cross Encoder a Good Teacher for Efficient Image-Text Retrieval?
par: Chen, Yuxin, et autres
Publié: (2024)
par: Chen, Yuxin, et autres
Publié: (2024)
Knowledge Guided Entity-aware Video Captioning and A Basketball Benchmark
par: Xi, Zeyu, et autres
Publié: (2024)
par: Xi, Zeyu, et autres
Publié: (2024)
SGCap: Decoding Semantic Group for Zero-shot Video Captioning
par: Pan, Zeyu, et autres
Publié: (2025)
par: Pan, Zeyu, et autres
Publié: (2025)
LFS: Learnable Frame Selector for Event-Aware and Temporally Diverse Video Captioning
par: Chao, Lianying, et autres
Publié: (2026)
par: Chao, Lianying, et autres
Publié: (2026)
Explicit Temporal-Semantic Modeling for Dense Video Captioning via Context-Aware Cross-Modal Interaction
par: Jia, Mingda, et autres
Publié: (2025)
par: Jia, Mingda, et autres
Publié: (2025)
PMCE: Probabilistic Multi-Granularity Semantics with Caption-Guided Enhancement for Few-Shot Learning
par: Wu, Jiaying, et autres
Publié: (2026)
par: Wu, Jiaying, et autres
Publié: (2026)
DetailFusion: A Dual-branch Framework with Detail Enhancement for Composed Image Retrieval
par: Yang, Yuxin, et autres
Publié: (2025)
par: Yang, Yuxin, et autres
Publié: (2025)
OpenSubject: Leveraging Video-Derived Identity and Diversity Priors for Subject-driven Image Generation and Manipulation
par: Liu, Yexin, et autres
Publié: (2025)
par: Liu, Yexin, et autres
Publié: (2025)
Captioning Daily Activity Images in Early Childhood Education: Benchmark and Algorithm
par: Li, Sixing, et autres
Publié: (2026)
par: Li, Sixing, et autres
Publié: (2026)
OwlCap: Harmonizing Motion-Detail for Video Captioning via HMD-270K and Caption Set Equivalence Reward
par: Zhong, Chunlin, et autres
Publié: (2025)
par: Zhong, Chunlin, et autres
Publié: (2025)
Scene Graph-guided SegCaptioning Transformer with Fine-grained Alignment for Controllable Video Segmentation and Captioning
par: Zhang, Xu, et autres
Publié: (2026)
par: Zhang, Xu, et autres
Publié: (2026)
MIBench: Evaluating Multimodal Large Language Models over Multiple Images
par: Liu, Haowei, et autres
Publié: (2024)
par: Liu, Haowei, et autres
Publié: (2024)
AVC-DPO: Aligned Video Captioning via Direct Preference Optimization
par: Tang, Jiyang, et autres
Publié: (2025)
par: Tang, Jiyang, et autres
Publié: (2025)
VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking
par: Meng, Desen, et autres
Publié: (2025)
par: Meng, Desen, et autres
Publié: (2025)
FIOVA: A Multi-Annotator Benchmark for Human-Aligned Video Captioning
par: Hu, Shiyu, et autres
Publié: (2024)
par: Hu, Shiyu, et autres
Publié: (2024)
SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction
par: Zhang, Zhixiong, et autres
Publié: (2026)
par: Zhang, Zhixiong, et autres
Publié: (2026)
Sam-Guided Enhanced Fine-Grained Encoding with Mixed Semantic Learning for Medical Image Captioning
par: Zhang, Zhenyu, et autres
Publié: (2023)
par: Zhang, Zhenyu, et autres
Publié: (2023)
Erosion Attack for Adversarial Training to Enhance Semantic Segmentation Robustness
par: Song, Yufei, et autres
Publié: (2026)
par: Song, Yufei, et autres
Publié: (2026)
UltraVideo: High-Quality UHD Video Dataset with Comprehensive Captions
par: Xue, Zhucun, et autres
Publié: (2025)
par: Xue, Zhucun, et autres
Publié: (2025)
Dense Video Captioning Using Unsupervised Semantic Information
par: Estevam, Valter, et autres
Publié: (2021)
par: Estevam, Valter, et autres
Publié: (2021)
Addressing the ID-Matching Challenge in Long Video Captioning
par: Yang, Zhantao, et autres
Publié: (2025)
par: Yang, Zhantao, et autres
Publié: (2025)
Single-step Diffusion-based Video Coding with Semantic-Temporal Guidance
par: Xue, Naifu, et autres
Publié: (2025)
par: Xue, Naifu, et autres
Publié: (2025)
HiSem: Hierarchical Semantic Disentangling for Remote Sensing Image Change Captioning
par: Wang, Man, et autres
Publié: (2026)
par: Wang, Man, et autres
Publié: (2026)
EMMA: Concept Erasure Benchmark with Comprehensive Semantic Metrics and Diverse Categories
par: Wei, Lu, et autres
Publié: (2025)
par: Wei, Lu, et autres
Publié: (2025)
SEAGULL: No-reference Image Quality Assessment for Regions of Interest via Vision-Language Instruction Tuning
par: Chen, Zewen, et autres
Publié: (2024)
par: Chen, Zewen, et autres
Publié: (2024)
Exploiting Auxiliary Caption for Video Grounding
par: Li, Hongxiang, et autres
Publié: (2023)
par: Li, Hongxiang, et autres
Publié: (2023)
ShareGPT4Video: Improving Video Understanding and Generation with Better Captions
par: Chen, Lin, et autres
Publié: (2024)
par: Chen, Lin, et autres
Publié: (2024)
SGDiff: Scene Graph Guided Diffusion Model for Image Collaborative SegCaptioning
par: Zhang, Xu, et autres
Publié: (2025)
par: Zhang, Xu, et autres
Publié: (2025)
OmniCaptioner: One Captioner to Rule Them All
par: Lu, Yiting, et autres
Publié: (2025)
par: Lu, Yiting, et autres
Publié: (2025)
SAMA: Factorized Semantic Anchoring and Motion Alignment for Instruction-Guided Video Editing
par: Zhang, Xinyao, et autres
Publié: (2026)
par: Zhang, Xinyao, et autres
Publié: (2026)
Documents similaires
-
Mitigating Hallucinations in Large Vision-Language Models by Self-Injecting Hallucinations
par: Lu, Yifan, et autres
Publié: (2025) -
Beyond Semantic Search: Towards Referential Anchoring in Composed Image Retrieval
par: Yang, Yuxin, et autres
Publié: (2026) -
EA-VTR: Event-Aware Video-Text Retrieval
par: Ma, Zongyang, et autres
Publié: (2024) -
GMC-IQA: Exploiting Global-correlation and Mean-opinion Consistency for No-reference Image Quality Assessment
par: Chen, Zewen, et autres
Publié: (2024) -
Semantics-enhanced Cross-modal Masked Image Modeling for Vision-Language Pre-training
par: Liu, Haowei, et autres
Publié: (2024)