OTTER: Open-Tagging via Text-Image Representation for Multi-modal Understanding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ouyang, Jieer, Xiang, Xiaoneng, Wang, Zheng, Ding, Yangkai |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Semantic Draw Engineering for Text-to-Image Creation
par: Li, Yang, et autres
Publié: (2023)
par: Li, Yang, et autres
Publié: (2023)
Tag2Text: Guiding Vision-Language Model via Image Tagging
par: Huang, Xinyu, et autres
Publié: (2023)
par: Huang, Xinyu, et autres
Publié: (2023)
Sur2f: A Hybrid Representation for High-Quality and Efficient Surface Reconstruction from Multi-view Images
par: Huang, Zhangjin, et autres
Publié: (2024)
par: Huang, Zhangjin, et autres
Publié: (2024)
OTTER: A Vision-Language-Action Model with Text-Aware Visual Feature Extraction
par: Huang, Huang, et autres
Publié: (2025)
par: Huang, Huang, et autres
Publié: (2025)
HYDRA: Unifying Multi-modal Generation and Understanding via Representation-Harmonized Tokenization
par: Qiu, Xuerui, et autres
Publié: (2026)
par: Qiu, Xuerui, et autres
Publié: (2026)
MMGen: Unified Multi-modal Image Generation and Understanding in One Go
par: Wang, Jiepeng, et autres
Publié: (2025)
par: Wang, Jiepeng, et autres
Publié: (2025)
TTD: Text-Tag Self-Distillation Enhancing Image-Text Alignment in CLIP to Alleviate Single Tag Bias
par: Jo, Sanghyun, et autres
Publié: (2024)
par: Jo, Sanghyun, et autres
Publié: (2024)
Multi-StyleGS: Stylizing Gaussian Splatting with Multiple Styles
par: Lin, Yangkai, et autres
Publié: (2025)
par: Lin, Yangkai, et autres
Publié: (2025)
SCMM: Calibrating Cross-modal Representations for Text-Based Person Search
par: Liu, Jing, et autres
Publié: (2023)
par: Liu, Jing, et autres
Publié: (2023)
MM-Interleaved: Interleaved Image-Text Generative Modeling via Multi-modal Feature Synchronizer
par: Tian, Changyao, et autres
Publié: (2024)
par: Tian, Changyao, et autres
Publié: (2024)
Multi-modal Reference Learning for Fine-grained Text-to-Image Retrieval
par: Ma, Zehong, et autres
Publié: (2025)
par: Ma, Zehong, et autres
Publié: (2025)
DocLayLLM: An Efficient Multi-modal Extension of Large Language Models for Text-rich Document Understanding
par: Liao, Wenhui, et autres
Publié: (2024)
par: Liao, Wenhui, et autres
Publié: (2024)
DialogGen: Multi-modal Interactive Dialogue System for Multi-turn Text-to-Image Generation
par: Huang, Minbin, et autres
Publié: (2024)
par: Huang, Minbin, et autres
Publié: (2024)
Asymmetric Reinforcing against Multi-modal Representation Bias
par: Gao, Xiyuan, et autres
Publié: (2025)
par: Gao, Xiyuan, et autres
Publié: (2025)
OpenMEDLab: An Open-source Platform for Multi-modality Foundation Models in Medicine
par: Wang, Xiaosong, et autres
Publié: (2024)
par: Wang, Xiaosong, et autres
Publié: (2024)
MVBench: A Comprehensive Multi-modal Video Understanding Benchmark
par: Li, Kunchang, et autres
Publié: (2023)
par: Li, Kunchang, et autres
Publié: (2023)
TiFRe: Text-guided Video Frame Reduction for Efficient Video Multi-modal Large Language Models
par: Zheng, Xiangtian, et autres
Publié: (2026)
par: Zheng, Xiangtian, et autres
Publié: (2026)
Multi-Grained Cross-modal Alignment for Learning Open-vocabulary Semantic Segmentation from Text Supervision
par: Liu, Yajie, et autres
Publié: (2024)
par: Liu, Yajie, et autres
Publié: (2024)
CoF: Coarse to Fine-Grained Image Understanding for Multi-modal Large Language Models
par: Wang, Yeyuan, et autres
Publié: (2024)
par: Wang, Yeyuan, et autres
Publié: (2024)
Image Anything: Towards Reasoning-coherent and Training-free Multi-modal Image Generation
par: Lyu, Yuanhuiyi, et autres
Publié: (2024)
par: Lyu, Yuanhuiyi, et autres
Publié: (2024)
LLM-enhanced Action-aware Multi-modal Prompt Tuning for Image-Text Matching
par: Tian, Mengxiao, et autres
Publié: (2025)
par: Tian, Mengxiao, et autres
Publié: (2025)
Open-World Human-Object Interaction Detection via Multi-modal Prompts
par: Yang, Jie, et autres
Publié: (2024)
par: Yang, Jie, et autres
Publié: (2024)
Understanding the Multi-modal Prompts of the Pre-trained Vision-Language Model
par: Ma, Shuailei, et autres
Publié: (2023)
par: Ma, Shuailei, et autres
Publié: (2023)
Multi-Granularity and Multi-modal Feature Interaction Approach for Text Video Retrieval
par: Li, Wenjun, et autres
Publié: (2024)
par: Li, Wenjun, et autres
Publié: (2024)
Mirror in the Model: Ad Banner Image Generation via Reflective Multi-LLM and Multi-modal Agents
par: Wang, Zhao, et autres
Publié: (2025)
par: Wang, Zhao, et autres
Publié: (2025)
ViSTA: Visual Storytelling using Multi-modal Adapters for Text-to-Image Diffusion Models
par: Dong, Sibo, et autres
Publié: (2025)
par: Dong, Sibo, et autres
Publié: (2025)
Scaling Text-to-Image Diffusion Transformers with Representation Autoencoders
par: Tong, Shengbang, et autres
Publié: (2026)
par: Tong, Shengbang, et autres
Publié: (2026)
FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering
par: Cheng, Zheng, et autres
Publié: (2024)
par: Cheng, Zheng, et autres
Publié: (2024)
LVLM-empowered Multi-modal Representation Learning for Visual Place Recognition
par: Wang, Teng, et autres
Publié: (2024)
par: Wang, Teng, et autres
Publié: (2024)
Cross-domain Multi-modal Few-shot Object Detection via Rich Text
par: Shangguan, Zeyu, et autres
Publié: (2024)
par: Shangguan, Zeyu, et autres
Publié: (2024)
Multi-modal Semantic Understanding with Contrastive Cross-modal Feature Alignment
par: Zhang, Ming, et autres
Publié: (2024)
par: Zhang, Ming, et autres
Publié: (2024)
TagAlign: Improving Vision-Language Alignment with Multi-Tag Classification
par: Liu, Qinying, et autres
Publié: (2023)
par: Liu, Qinying, et autres
Publié: (2023)
SceneLCM: End-to-End Layout-Guided Interactive Indoor Scene Generation with Latent Consistency Model
par: Lin, Yangkai, et autres
Publié: (2025)
par: Lin, Yangkai, et autres
Publié: (2025)
Monkey: Image Resolution and Text Label Are Important Things for Large Multi-modal Models
par: Li, Zhang, et autres
Publié: (2023)
par: Li, Zhang, et autres
Publié: (2023)
Object Affordance Recognition and Grounding via Multi-scale Cross-modal Representation Learning
par: Wan, Xinhang, et autres
Publié: (2025)
par: Wan, Xinhang, et autres
Publié: (2025)
EventBind: Learning a Unified Representation to Bind Them All for Event-based Open-world Understanding
par: Zhou, Jiazhou, et autres
Publié: (2023)
par: Zhou, Jiazhou, et autres
Publié: (2023)
TokenCompose: Text-to-Image Diffusion with Token-level Supervision
par: Wang, Zirui, et autres
Publié: (2023)
par: Wang, Zirui, et autres
Publié: (2023)
Coherent and Multi-modality Image Inpainting via Latent Space Optimization
par: Pan, Lingzhi, et autres
Publié: (2024)
par: Pan, Lingzhi, et autres
Publié: (2024)
Cross-modal Context-aware Learning for Visual Prompt Guided Multimodal Image Understanding in Remote Sensing
par: Zhang, Xu, et autres
Publié: (2025)
par: Zhang, Xu, et autres
Publié: (2025)
CMViM: Contrastive Masked Vim Autoencoder for 3D Multi-modal Representation Learning for AD classification
par: Yang, Guangqian, et autres
Publié: (2024)
par: Yang, Guangqian, et autres
Publié: (2024)
Documents similaires
-
Semantic Draw Engineering for Text-to-Image Creation
par: Li, Yang, et autres
Publié: (2023) -
Tag2Text: Guiding Vision-Language Model via Image Tagging
par: Huang, Xinyu, et autres
Publié: (2023) -
Sur2f: A Hybrid Representation for High-Quality and Efficient Surface Reconstruction from Multi-view Images
par: Huang, Zhangjin, et autres
Publié: (2024) -
OTTER: A Vision-Language-Action Model with Text-Aware Visual Feature Extraction
par: Huang, Huang, et autres
Publié: (2025) -
HYDRA: Unifying Multi-modal Generation and Understanding via Representation-Harmonized Tokenization
par: Qiu, Xuerui, et autres
Publié: (2026)