StitchFusion: Weaving Any Visual Modalities to Enhance Multimodal Semantic Segmentation
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Bingyu, Zhang, Da, Zhao, Zhiyuan, Gao, Junyu, Li, Xuelong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
U3M: Unbiased Multiscale Modal Fusion Model for Multimodal Semantic Segmentation
por: Li, Bingyu, et al.
Publicado: (2024)
por: Li, Bingyu, et al.
Publicado: (2024)
MARIS: Marine Open-Vocabulary Instance Segmentation with Geometric Enhancement and Semantic Alignment
por: Li, Bingyu, et al.
Publicado: (2025)
por: Li, Bingyu, et al.
Publicado: (2025)
Exploring Efficient Open-Vocabulary Segmentation in the Remote Sensing
por: Li, Bingyu, et al.
Publicado: (2025)
por: Li, Bingyu, et al.
Publicado: (2025)
Exploring the Underwater World Segmentation without Extra Training
por: Li, Bingyu, et al.
Publicado: (2025)
por: Li, Bingyu, et al.
Publicado: (2025)
An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation
por: Li, Bingyu, et al.
Publicado: (2026)
por: Li, Bingyu, et al.
Publicado: (2026)
Quantum-inspired Interpretable Deep Learning Architecture for Text Sentiment Analysis
por: Li, Bingyu, et al.
Publicado: (2024)
por: Li, Bingyu, et al.
Publicado: (2024)
FGAseg: Fine-Grained Pixel-Text Alignment for Open-Vocabulary Semantic Segmentation
por: Li, Bingyu, et al.
Publicado: (2025)
por: Li, Bingyu, et al.
Publicado: (2025)
Do MLLMs Really See It: Reinforcing Visual Attention in Multimodal LLMs
por: Ou, Siqu, et al.
Publicado: (2026)
por: Ou, Siqu, et al.
Publicado: (2026)
Segment Any Vehicle: Semantic and Visual Context Driven SAM and A Benchmark
por: Wang, Xiao, et al.
Publicado: (2025)
por: Wang, Xiao, et al.
Publicado: (2025)
From Captions to Rewards (CAREVL): Leveraging Large Language Model Experts for Enhanced Reward Modeling in Large Vision-Language Models
por: Dai, Muzhi, et al.
Publicado: (2025)
por: Dai, Muzhi, et al.
Publicado: (2025)
Towards Realistic Open-Vocabulary Remote Sensing Segmentation: Benchmark and Baseline
por: Li, Bingyu, et al.
Publicado: (2026)
por: Li, Bingyu, et al.
Publicado: (2026)
(Almost) Free Modality Stitching of Foundation Models
por: Singh, Jaisidh, et al.
Publicado: (2025)
por: Singh, Jaisidh, et al.
Publicado: (2025)
4M-21: An Any-to-Any Vision Model for Tens of Tasks and Modalities
por: Bachmann, Roman, et al.
Publicado: (2024)
por: Bachmann, Roman, et al.
Publicado: (2024)
Enhancing Modal Fusion by Alignment and Label Matching for Multimodal Emotion Recognition
por: Li, Qifei, et al.
Publicado: (2024)
por: Li, Qifei, et al.
Publicado: (2024)
Dynamic Proxy Domain Generalizes the Crowd Localization by Better Binary Segmentation
por: Gao, Junyu, et al.
Publicado: (2024)
por: Gao, Junyu, et al.
Publicado: (2024)
Prototype-Based Low Altitude UAV Semantic Segmentation
por: Zhang, Da, et al.
Publicado: (2026)
por: Zhang, Da, et al.
Publicado: (2026)
Decoupling the Image Perception and Multimodal Reasoning for Reasoning Segmentation with Digital Twin Representations
por: Li, Yizhen, et al.
Publicado: (2025)
por: Li, Yizhen, et al.
Publicado: (2025)
Stitch: Training-Free Position Control in Multimodal Diffusion Transformers
por: Bader, Jessica, et al.
Publicado: (2025)
por: Bader, Jessica, et al.
Publicado: (2025)
Stitched Value Model for Diffusion Alignment
por: Go, Hyojun, et al.
Publicado: (2026)
por: Go, Hyojun, et al.
Publicado: (2026)
Tracking and Segmenting Anything in Any Modality
por: Zhang, Tianlu, et al.
Publicado: (2025)
por: Zhang, Tianlu, et al.
Publicado: (2025)
UWBench: A Comprehensive Vision-Language Benchmark for Underwater Understanding
por: Zhang, Da, et al.
Publicado: (2025)
por: Zhang, Da, et al.
Publicado: (2025)
Dynamic Cross-Modal Prompt Generation for Multimodal Continual Instruction Tuning
por: Hu, Tao, et al.
Publicado: (2026)
por: Hu, Tao, et al.
Publicado: (2026)
Fusion to Enhance: Fusion Visual Encoder to Enhance Multimodal Language Model
por: She, Yifei, et al.
Publicado: (2025)
por: She, Yifei, et al.
Publicado: (2025)
PAM: A Propagation-Based Model for Segmenting Any 3D Objects across Multi-Modal Medical Images
por: Chen, Zifan, et al.
Publicado: (2024)
por: Chen, Zifan, et al.
Publicado: (2024)
LIX: Implicitly Infusing Spatial Geometric Prior Knowledge into Visual Semantic Segmentation for Autonomous Driving
por: Guo, Sicen, et al.
Publicado: (2024)
por: Guo, Sicen, et al.
Publicado: (2024)
AnyMo: Scaling Any-Modality Conditional Motion Generation with Masked Modeling
por: Li, Yiheng, et al.
Publicado: (2026)
por: Li, Yiheng, et al.
Publicado: (2026)
Unifying Visual and Semantic Feature Spaces with Diffusion Models for Enhanced Cross-Modal Alignment
por: Zheng, Yuze, et al.
Publicado: (2024)
por: Zheng, Yuze, et al.
Publicado: (2024)
Diagnosing and Mitigating Modality Interference in Multimodal Large Language Models
por: Cai, Rui, et al.
Publicado: (2025)
por: Cai, Rui, et al.
Publicado: (2025)
ClassWise-CRF: Category-Specific Fusion for Enhanced Semantic Segmentation of Remote Sensing Imagery
por: Zhu, Qinfeng, et al.
Publicado: (2025)
por: Zhu, Qinfeng, et al.
Publicado: (2025)
AnyFit: Controllable Virtual Try-on for Any Combination of Attire Across Any Scenario
por: Li, Yuhan, et al.
Publicado: (2024)
por: Li, Yuhan, et al.
Publicado: (2024)
MiMIC: Mitigating Visual Modality Collapse in Universal Multimodal Retrieval While Avoiding Semantic Misalignment
por: Li, Juan, et al.
Publicado: (2026)
por: Li, Juan, et al.
Publicado: (2026)
Generate Any Scene: Scene Graph Driven Data Synthesis for Visual Generation Training
por: Gao, Ziqi, et al.
Publicado: (2024)
por: Gao, Ziqi, et al.
Publicado: (2024)
VIFO: Visual Feature Empowered Multivariate Time Series Forecasting with Cross-Modal Fusion
por: Wang, Yanlong, et al.
Publicado: (2025)
por: Wang, Yanlong, et al.
Publicado: (2025)
Adaptive Interactive Segmentation for Multimodal Medical Imaging via Selection Engine
por: Li, Zhi, et al.
Publicado: (2024)
por: Li, Zhi, et al.
Publicado: (2024)
Stitch and Tell: A Structured Multimodal Data Augmentation Method for Spatial Understanding
por: Yin, Hang, et al.
Publicado: (2025)
por: Yin, Hang, et al.
Publicado: (2025)
SSVP: Synergistic Semantic-Visual Prompting for Industrial Zero-Shot Anomaly Detection
por: Fu, Chenhao, et al.
Publicado: (2026)
por: Fu, Chenhao, et al.
Publicado: (2026)
Boosting Quantitive and Spatial Awareness for Zero-Shot Object Counting
por: Zhang, Da, et al.
Publicado: (2026)
por: Zhang, Da, et al.
Publicado: (2026)
ECMF: Enhanced Cross-Modal Fusion for Multimodal Emotion Recognition in MER-SEMI Challenge
por: Hu, Juewen, et al.
Publicado: (2025)
por: Hu, Juewen, et al.
Publicado: (2025)
Interleaved-Modal Chain-of-Thought
por: Gao, Jun, et al.
Publicado: (2024)
por: Gao, Jun, et al.
Publicado: (2024)
SEMIR: Semantic Minor-Induced Representation Learning on Graphs for Visual Segmentation
por: Miller, Luke James, et al.
Publicado: (2026)
por: Miller, Luke James, et al.
Publicado: (2026)
Ejemplares similares
-
U3M: Unbiased Multiscale Modal Fusion Model for Multimodal Semantic Segmentation
por: Li, Bingyu, et al.
Publicado: (2024) -
MARIS: Marine Open-Vocabulary Instance Segmentation with Geometric Enhancement and Semantic Alignment
por: Li, Bingyu, et al.
Publicado: (2025) -
Exploring Efficient Open-Vocabulary Segmentation in the Remote Sensing
por: Li, Bingyu, et al.
Publicado: (2025) -
Exploring the Underwater World Segmentation without Extra Training
por: Li, Bingyu, et al.
Publicado: (2025) -
An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation
por: Li, Bingyu, et al.
Publicado: (2026)