ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Peng, Cihang, Hou, Qiming, Ren, Zhong, Zhou, Kun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Panoptic Captioning: An Equivalence Bridge for Image and Text
di: Lin, Kun-Yu, et al.
Pubblicazione: (2025)
di: Lin, Kun-Yu, et al.
Pubblicazione: (2025)
GHOST: Grounded Human Motion Generation with Open Vocabulary Scene-and-Text Contexts
di: Milacski, Zoltán Á., et al.
Pubblicazione: (2024)
di: Milacski, Zoltán Á., et al.
Pubblicazione: (2024)
Unified Embedding Alignment for Open-Vocabulary Video Instance Segmentation
di: Fang, Hao, et al.
Pubblicazione: (2024)
di: Fang, Hao, et al.
Pubblicazione: (2024)
IFAdapter: Instance Feature Control for Grounded Text-to-Image Generation
di: Wu, Yinwei, et al.
Pubblicazione: (2024)
di: Wu, Yinwei, et al.
Pubblicazione: (2024)
InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption
di: Fan, Tiehan, et al.
Pubblicazione: (2024)
di: Fan, Tiehan, et al.
Pubblicazione: (2024)
Synthetic Captions for Open-Vocabulary Zero-Shot Segmentation
di: Lebailly, Tim, et al.
Pubblicazione: (2025)
di: Lebailly, Tim, et al.
Pubblicazione: (2025)
Mitigating Open-Vocabulary Caption Hallucinations
di: Ben-Kish, Assaf, et al.
Pubblicazione: (2023)
di: Ben-Kish, Assaf, et al.
Pubblicazione: (2023)
Open-Vocabulary Scene Text Recognition via Pseudo-Image Labeling and Margin Loss
di: Ren, Xuhua, et al.
Pubblicazione: (2024)
di: Ren, Xuhua, et al.
Pubblicazione: (2024)
Exploiting VLM Localizability and Semantics for Open Vocabulary Action Detection
di: Bao, Wentao, et al.
Pubblicazione: (2024)
di: Bao, Wentao, et al.
Pubblicazione: (2024)
OVI-MAP:Open-Vocabulary Instance-Semantic Mapping
di: Deng, Zilong, et al.
Pubblicazione: (2026)
di: Deng, Zilong, et al.
Pubblicazione: (2026)
Progressive Radiance Distillation for Inverse Rendering with Gaussian Splatting
di: Ye, Keyang, et al.
Pubblicazione: (2024)
di: Ye, Keyang, et al.
Pubblicazione: (2024)
Open-Vocabulary Object Detection with Meta Prompt Representation and Instance Contrastive Optimization
di: Wang, Zhao, et al.
Pubblicazione: (2024)
di: Wang, Zhao, et al.
Pubblicazione: (2024)
Instance Brownian Bridge as Texts for Open-vocabulary Video Instance Segmentation
di: Cheng, Zesen, et al.
Pubblicazione: (2024)
di: Cheng, Zesen, et al.
Pubblicazione: (2024)
OVFact: Measuring and Improving Open-Vocabulary Factuality for Long Caption Models
di: Wysoczańska, Monika, et al.
Pubblicazione: (2025)
di: Wysoczańska, Monika, et al.
Pubblicazione: (2025)
Improving Text Generation on Images with Synthetic Captions
di: Koh, Jun Young, et al.
Pubblicazione: (2024)
di: Koh, Jun Young, et al.
Pubblicazione: (2024)
Towards Real-Time Open-Vocabulary Video Instance Segmentation
di: Yan, Bin, et al.
Pubblicazione: (2024)
di: Yan, Bin, et al.
Pubblicazione: (2024)
M$^{2}$Chat: Empowering VLM for Multimodal LLM Interleaved Text-Image Generation
di: Chi, Xiaowei, et al.
Pubblicazione: (2023)
di: Chi, Xiaowei, et al.
Pubblicazione: (2023)
OpenTrack3D: Towards Accurate and Generalizable Open-Vocabulary 3D Instance Segmentation
di: Zhou, Zhishan, et al.
Pubblicazione: (2025)
di: Zhou, Zhishan, et al.
Pubblicazione: (2025)
Open-Vocabulary 3D Semantic Segmentation with Text-to-Image Diffusion Models
di: Zhu, Xiaoyu, et al.
Pubblicazione: (2024)
di: Zhu, Xiaoyu, et al.
Pubblicazione: (2024)
SynthVLM: Towards High-Quality and Efficient Synthesis of Image-Caption Datasets for Vision-Language Models
di: Liu, Zheng, et al.
Pubblicazione: (2024)
di: Liu, Zheng, et al.
Pubblicazione: (2024)
Grounded Video Caption Generation
di: Kazakos, Evangelos, et al.
Pubblicazione: (2024)
di: Kazakos, Evangelos, et al.
Pubblicazione: (2024)
MIGC: Multi-Instance Generation Controller for Text-to-Image Synthesis
di: Zhou, Dewei, et al.
Pubblicazione: (2024)
di: Zhou, Dewei, et al.
Pubblicazione: (2024)
PhraseStereo: The First Open-Vocabulary Stereo Image Segmentation Dataset
di: Campagnolo, Thomas, et al.
Pubblicazione: (2025)
di: Campagnolo, Thomas, et al.
Pubblicazione: (2025)
3D Gaussian Splatting with Deferred Reflection
di: Ye, Keyang, et al.
Pubblicazione: (2024)
di: Ye, Keyang, et al.
Pubblicazione: (2024)
CLIP-VIS: Adapting CLIP for Open-Vocabulary Video Instance Segmentation
di: Zhu, Wenqi, et al.
Pubblicazione: (2024)
di: Zhu, Wenqi, et al.
Pubblicazione: (2024)
Visual Programming for Zero-shot Open-Vocabulary 3D Visual Grounding
di: Yuan, Zhihao, et al.
Pubblicazione: (2023)
di: Yuan, Zhihao, et al.
Pubblicazione: (2023)
Filter & Align: Leveraging Human Knowledge to Curate Image-Text Data
di: Zhang, Lei, et al.
Pubblicazione: (2023)
di: Zhang, Lei, et al.
Pubblicazione: (2023)
Open-Vocabulary Video Anomaly Detection
di: Wu, Peng, et al.
Pubblicazione: (2023)
di: Wu, Peng, et al.
Pubblicazione: (2023)
OpenVoxel: Training-Free Grouping and Captioning Voxels for Open-Vocabulary 3D Scene Understanding
di: Huang, Sheng-Yu, et al.
Pubblicazione: (2026)
di: Huang, Sheng-Yu, et al.
Pubblicazione: (2026)
Praxis-VLM: Vision-Grounded Decision Making via Text-Driven Reinforcement Learning
di: Hu, Zhe, et al.
Pubblicazione: (2025)
di: Hu, Zhe, et al.
Pubblicazione: (2025)
Affogato: Learning Open-Vocabulary Affordance Grounding with Automated Data Generation at Scale
di: Lee, Junha, et al.
Pubblicazione: (2025)
di: Lee, Junha, et al.
Pubblicazione: (2025)
ExpAlign: Expectation-Guided Vision-Language Alignment for Open-Vocabulary Grounding
di: Hu, Junyi, et al.
Pubblicazione: (2026)
di: Hu, Junyi, et al.
Pubblicazione: (2026)
Evaluating Image Caption via Cycle-consistent Text-to-Image Generation
di: Cui, Tianyu, et al.
Pubblicazione: (2025)
di: Cui, Tianyu, et al.
Pubblicazione: (2025)
CLIPS: An Enhanced CLIP Framework for Learning with Synthetic Captions
di: Liu, Yanqing, et al.
Pubblicazione: (2024)
di: Liu, Yanqing, et al.
Pubblicazione: (2024)
RTGen: Generating Region-Text Pairs for Open-Vocabulary Object Detection
di: Chen, Fangyi, et al.
Pubblicazione: (2024)
di: Chen, Fangyi, et al.
Pubblicazione: (2024)
SCORE: Scene Context Matters in Open-Vocabulary Remote Sensing Instance Segmentation
di: Huang, Shiqi, et al.
Pubblicazione: (2025)
di: Huang, Shiqi, et al.
Pubblicazione: (2025)
Open-Vocabulary Domain Generalization in Urban-Scene Segmentation
di: Zhao, Dong, et al.
Pubblicazione: (2026)
di: Zhao, Dong, et al.
Pubblicazione: (2026)
Zero-Shot Open-Vocabulary Human Motion Grounding with Test-Time Training
di: Zhou, Yunjiao, et al.
Pubblicazione: (2025)
di: Zhou, Yunjiao, et al.
Pubblicazione: (2025)
Harnessing Caption Detailness for Data-Efficient Text-to-Image Generation
di: Wang, Xinran, et al.
Pubblicazione: (2025)
di: Wang, Xinran, et al.
Pubblicazione: (2025)
Re$^2$MoGen: Open-Vocabulary Motion Generation via LLM Reasoning and Physics-Aware Refinement
di: Zheng, Jiakun, et al.
Pubblicazione: (2026)
di: Zheng, Jiakun, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Panoptic Captioning: An Equivalence Bridge for Image and Text
di: Lin, Kun-Yu, et al.
Pubblicazione: (2025) -
GHOST: Grounded Human Motion Generation with Open Vocabulary Scene-and-Text Contexts
di: Milacski, Zoltán Á., et al.
Pubblicazione: (2024) -
Unified Embedding Alignment for Open-Vocabulary Video Instance Segmentation
di: Fang, Hao, et al.
Pubblicazione: (2024) -
IFAdapter: Instance Feature Control for Grounded Text-to-Image Generation
di: Wu, Yinwei, et al.
Pubblicazione: (2024) -
InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption
di: Fan, Tiehan, et al.
Pubblicazione: (2024)