Open-Vocabulary Federated Learning with Multimodal Prototyping
Fuente:
arXiv
Guardado en:
| Autores principales: | Zeng, Huimin, Yue, Zhenrui, Wang, Dong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Prototype-Aware Multimodal Alignment for Open-Vocabulary Visual Grounding
por: Xie, Jiangnan, et al.
Publicado: (2025)
por: Xie, Jiangnan, et al.
Publicado: (2025)
UGen: Unified Autoregressive Multimodal Model with Progressive Vocabulary Learning
por: Tang, Hongxuan, et al.
Publicado: (2025)
por: Tang, Hongxuan, et al.
Publicado: (2025)
DivScene: Towards Open-Vocabulary Object Navigation with Large Vision Language Models in Diverse Scenes
por: Wang, Zhaowei, et al.
Publicado: (2024)
por: Wang, Zhaowei, et al.
Publicado: (2024)
Open Vocabulary Panoptic Segmentation With Retrieval Augmentation
por: Sadeq, Nafis, et al.
Publicado: (2026)
por: Sadeq, Nafis, et al.
Publicado: (2026)
Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding
por: Wang, Yan, et al.
Publicado: (2025)
por: Wang, Yan, et al.
Publicado: (2025)
DM2RM: Dual-Mode Multimodal Ranking for Target Objects and Receptacles Based on Open-Vocabulary Instructions
por: Korekata, Ryosuke, et al.
Publicado: (2024)
por: Korekata, Ryosuke, et al.
Publicado: (2024)
Open-Vocabulary Mobile Manipulation Based on Double Relaxed Contrastive Learning with Dense Labeling
por: Yashima, Daichi, et al.
Publicado: (2024)
por: Yashima, Daichi, et al.
Publicado: (2024)
Real-time Transformer-based Open-Vocabulary Detection with Efficient Fusion Head
por: Zhao, Tiancheng, et al.
Publicado: (2024)
por: Zhao, Tiancheng, et al.
Publicado: (2024)
DCP-CLIP:A Coarse-to-Fine Framework for Open-Vocabulary Semantic Segmentation with Dual Interaction
por: Wang, Jing, et al.
Publicado: (2026)
por: Wang, Jing, et al.
Publicado: (2026)
An Iterative Feedback Mechanism for Improving Natural Language Class Descriptions in Open-Vocabulary Object Detection
por: Kim, Louis Y., et al.
Publicado: (2025)
por: Kim, Louis Y., et al.
Publicado: (2025)
Pangea: A Fully Open Multilingual Multimodal LLM for 39 Languages
por: Yue, Xiang, et al.
Publicado: (2024)
por: Yue, Xiang, et al.
Publicado: (2024)
Open-Vocabulary Object Detection via Language Hierarchy
por: Huang, Jiaxing, et al.
Publicado: (2024)
por: Huang, Jiaxing, et al.
Publicado: (2024)
O3SLM: Open Weight, Open Data, and Open Vocabulary Sketch-Language Model
por: Gupta, Rishi, et al.
Publicado: (2025)
por: Gupta, Rishi, et al.
Publicado: (2025)
Phonological Representation Learning for Isolated Signs Improves Out-of-Vocabulary Generalization
por: Kezar, Lee, et al.
Publicado: (2025)
por: Kezar, Lee, et al.
Publicado: (2025)
VK-Det: Visual Knowledge Guided Prototype Learning for Open-Vocabulary Aerial Object Detection
por: Yao, Jianhang, et al.
Publicado: (2025)
por: Yao, Jianhang, et al.
Publicado: (2025)
Transferable and Principled Efficiency for Open-Vocabulary Segmentation
por: Xu, Jingxuan, et al.
Publicado: (2024)
por: Xu, Jingxuan, et al.
Publicado: (2024)
LLaVA-Critic: Learning to Evaluate Multimodal Models
por: Xiong, Tianyi, et al.
Publicado: (2024)
por: Xiong, Tianyi, et al.
Publicado: (2024)
Can Large Vision-Language Models Understand Multimodal Sarcasm?
por: Wang, Xinyu, et al.
Publicado: (2025)
por: Wang, Xinyu, et al.
Publicado: (2025)
Training-Free Open-Vocabulary Segmentation with Offline Diffusion-Augmented Prototype Generation
por: Barsellotti, Luca, et al.
Publicado: (2024)
por: Barsellotti, Luca, et al.
Publicado: (2024)
State and Scene Enhanced Prototypes for Weakly Supervised Open-Vocabulary Object Detection
por: Zhou, Jiaying, et al.
Publicado: (2025)
por: Zhou, Jiaying, et al.
Publicado: (2025)
Exploring Boundary of GPT-4V on Marine Analysis: A Preliminary Case Study
por: Zheng, Ziqiang, et al.
Publicado: (2024)
por: Zheng, Ziqiang, et al.
Publicado: (2024)
OCTO+: A Suite for Automatic Open-Vocabulary Object Placement in Mixed Reality
por: Sharma, Aditya, et al.
Publicado: (2024)
por: Sharma, Aditya, et al.
Publicado: (2024)
DualToken: Towards Unifying Visual Understanding and Generation with Dual Visual Vocabularies
por: Song, Wei, et al.
Publicado: (2025)
por: Song, Wei, et al.
Publicado: (2025)
Multimodal Reasoning for Science: Technical Report and 1st Place Solution to the ICML 2025 SeePhys Challenge
por: Liang, Hao, et al.
Publicado: (2025)
por: Liang, Hao, et al.
Publicado: (2025)
Toward Robust Incomplete Multimodal Sentiment Analysis via Hierarchical Representation Learning
por: Li, Mingcheng, et al.
Publicado: (2024)
por: Li, Mingcheng, et al.
Publicado: (2024)
ODE: Open-Set Evaluation of Hallucinations in Multimodal Large Language Models
por: Tu, Yahan, et al.
Publicado: (2024)
por: Tu, Yahan, et al.
Publicado: (2024)
Talking to DINO: Bridging Self-Supervised Vision Backbones with Language for Open-Vocabulary Segmentation
por: Barsellotti, Luca, et al.
Publicado: (2024)
por: Barsellotti, Luca, et al.
Publicado: (2024)
OpenDPR: Open-Vocabulary Change Detection via Vision-Centric Diffusion-Guided Prototype Retrieval for Remote Sensing Imagery
por: Guo, Qi, et al.
Publicado: (2026)
por: Guo, Qi, et al.
Publicado: (2026)
Large Multilingual Models Pivot Zero-Shot Multimodal Learning across Languages
por: Hu, Jinyi, et al.
Publicado: (2023)
por: Hu, Jinyi, et al.
Publicado: (2023)
ShredBench: Evaluating the Semantic Reasoning Capabilities of Multimodal LLMs in Document Reconstruction
por: Guo, Zichun, et al.
Publicado: (2026)
por: Guo, Zichun, et al.
Publicado: (2026)
World-to-Words: Grounded Open Vocabulary Acquisition through Fast Mapping in Vision-Language Models
por: Ma, Ziqiao, et al.
Publicado: (2023)
por: Ma, Ziqiao, et al.
Publicado: (2023)
Catch Me If You Can Describe Me: Open-Vocabulary Camouflaged Instance Segmentation with Diffusion
por: Vu, Tuan-Anh, et al.
Publicado: (2023)
por: Vu, Tuan-Anh, et al.
Publicado: (2023)
Attend to Evidence: Evidence-Anchored Spatial Attention Supervision for Multimodal RLVR
por: Hu, Ruina, et al.
Publicado: (2026)
por: Hu, Ruina, et al.
Publicado: (2026)
MSG-Chart: Multimodal Scene Graph for ChartQA
por: Dai, Yue, et al.
Publicado: (2024)
por: Dai, Yue, et al.
Publicado: (2024)
Reasoning Within the Mind: Dynamic Multimodal Interleaving in Latent Space
por: Liu, Chengzhi, et al.
Publicado: (2025)
por: Liu, Chengzhi, et al.
Publicado: (2025)
Less is More: Mitigating Multimodal Hallucination from an EOS Decision Perspective
por: Yue, Zihao, et al.
Publicado: (2024)
por: Yue, Zihao, et al.
Publicado: (2024)
Open-Source Multimodal Moxin Models with Moxin-VLM and Moxin-VLA
por: Zhao, Pu, et al.
Publicado: (2025)
por: Zhao, Pu, et al.
Publicado: (2025)
OpenOmni: Advancing Open-Source Omnimodal Large Language Models with Progressive Multimodal Alignment and Real-Time Self-Aware Emotional Speech Synthesis
por: Luo, Run, et al.
Publicado: (2025)
por: Luo, Run, et al.
Publicado: (2025)
VITA: Towards Open-Source Interactive Omni Multimodal LLM
por: Fu, Chaoyou, et al.
Publicado: (2024)
por: Fu, Chaoyou, et al.
Publicado: (2024)
Scene-Graph ViT: End-to-End Open-Vocabulary Visual Relationship Detection
por: Salzmann, Tim, et al.
Publicado: (2024)
por: Salzmann, Tim, et al.
Publicado: (2024)
Ejemplares similares
-
Prototype-Aware Multimodal Alignment for Open-Vocabulary Visual Grounding
por: Xie, Jiangnan, et al.
Publicado: (2025) -
UGen: Unified Autoregressive Multimodal Model with Progressive Vocabulary Learning
por: Tang, Hongxuan, et al.
Publicado: (2025) -
DivScene: Towards Open-Vocabulary Object Navigation with Large Vision Language Models in Diverse Scenes
por: Wang, Zhaowei, et al.
Publicado: (2024) -
Open Vocabulary Panoptic Segmentation With Retrieval Augmentation
por: Sadeq, Nafis, et al.
Publicado: (2026) -
Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding
por: Wang, Yan, et al.
Publicado: (2025)