Saved in:
| Main Authors: | Zhang, Zheng, Ma, Yeyao, Zhang, Enming, Bai, Xiang |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2403.14598 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
PopulAtion Parameter Averaging (PAPA)
by: Jolicoeur-Martineau, Alexia, et al.
Published: (2023)
by: Jolicoeur-Martineau, Alexia, et al.
Published: (2023)
FAIL: Flow Matching Adversarial Imitation Learning for Image Generation
by: Ma, Yeyao, et al.
Published: (2026)
by: Ma, Yeyao, et al.
Published: (2026)
First Multi-Dimensional Evaluation of Flowchart Comprehension for Multimodal Large Language Models
by: Zhang, Enming, et al.
Published: (2024)
by: Zhang, Enming, et al.
Published: (2024)
HAVANA: Hierarchical stochastic neighbor embedding for Accelerated Video ANnotAtions
by: Bobe, Alexandru, et al.
Published: (2024)
by: Bobe, Alexandru, et al.
Published: (2024)
View-Invariant Pixelwise Anomaly Detection in Multi-object Scenes with Adaptive View Synthesis
by: Varghese, Subin, et al.
Published: (2024)
by: Varghese, Subin, et al.
Published: (2024)
RAP-SR: RestorAtion Prior Enhancement in Diffusion Models for Realistic Image Super-Resolution
by: Wang, Jiangang, et al.
Published: (2024)
by: Wang, Jiangang, et al.
Published: (2024)
Multi-Modal Prototypes for Open-World Semantic Segmentation
by: Yang, Yuhuan, et al.
Published: (2023)
by: Yang, Yuhuan, et al.
Published: (2023)
C2PD: Continuity-Constrained Pixelwise Deformation for Guided Depth Super-Resolution
by: Kang, Jiahui, et al.
Published: (2025)
by: Kang, Jiahui, et al.
Published: (2025)
LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance
by: Li, Zhang, et al.
Published: (2025)
by: Li, Zhang, et al.
Published: (2025)
MiniDrive: More Efficient Vision-Language Models with Multi-Level 2D Features as Text Tokens for Autonomous Driving
by: Zhang, Enming, et al.
Published: (2024)
by: Zhang, Enming, et al.
Published: (2024)
Optimization of Prompt Learning via Multi-Knowledge Representation for Vision-Language Models
by: Zhang, Enming, et al.
Published: (2024)
by: Zhang, Enming, et al.
Published: (2024)
Multi-Modal Generative Embedding Model
by: Ma, Feipeng, et al.
Published: (2024)
by: Ma, Feipeng, et al.
Published: (2024)
Recognition-Oriented Low-Light Image Enhancement based on Global and Pixelwise Optimization
by: Ono, Seitaro, et al.
Published: (2025)
by: Ono, Seitaro, et al.
Published: (2025)
Reducing Experimental Testing in Space Propulsion Film Cooling Analyses by Pixelwise Generative Image Interpolation
by: Müller, Adam T., et al.
Published: (2026)
by: Müller, Adam T., et al.
Published: (2026)
MemorySAM: Memorize Modalities and Semantics with Segment Anything Model 2 for Multi-modal Semantic Segmentation
by: Liao, Chenfei, et al.
Published: (2025)
by: Liao, Chenfei, et al.
Published: (2025)
Large Motion Model for Unified Multi-Modal Motion Generation
by: Zhang, Mingyuan, et al.
Published: (2024)
by: Zhang, Mingyuan, et al.
Published: (2024)
DMAF-Net: An Effective Modality Rebalancing Framework for Incomplete Multi-Modal Medical Image Segmentation
by: Lan, Libin, et al.
Published: (2025)
by: Lan, Libin, et al.
Published: (2025)
Equivariant Multi-Modality Image Fusion
by: Zhao, Zixiang, et al.
Published: (2023)
by: Zhao, Zixiang, et al.
Published: (2023)
BiXFormer: A Robust Framework for Maximizing Modality Effectiveness in Multi-Modal Semantic Segmentation
by: Chen, Jialei, et al.
Published: (2025)
by: Chen, Jialei, et al.
Published: (2025)
Adversarial Versus Federated: An Adversarial Learning based Multi-Modality Cross-Domain Federated Medical Segmentation
by: Zhou, You, et al.
Published: (2025)
by: Zhou, You, et al.
Published: (2025)
Jailbreak Large Vision-Language Models Through Multi-Modal Linkage
by: Wang, Yu, et al.
Published: (2024)
by: Wang, Yu, et al.
Published: (2024)
Sigma: Siamese Mamba Network for Multi-Modal Semantic Segmentation
by: Wan, Zifu, et al.
Published: (2024)
by: Wan, Zifu, et al.
Published: (2024)
TMT: Cross-domain Semantic Segmentation with Region-adaptive Transferability Estimation
by: Zhang, Enming, et al.
Published: (2025)
by: Zhang, Enming, et al.
Published: (2025)
FusionSAM: Visual Multi-Modal Learning with Segment Anything
by: Li, Daixun, et al.
Published: (2024)
by: Li, Daixun, et al.
Published: (2024)
Customize Segment Anything Model for Multi-Modal Semantic Segmentation with Mixture of LoRA Experts
by: Zhu, Chenyang, et al.
Published: (2024)
by: Zhu, Chenyang, et al.
Published: (2024)
WaterMamba: Visual State Space Model for Underwater Image Enhancement
by: Guan, Meisheng, et al.
Published: (2024)
by: Guan, Meisheng, et al.
Published: (2024)
Causal Prompt Calibration Guided Segment Anything Model for Open-Vocabulary Multi-Entity Segmentation
by: Wang, Jingyao, et al.
Published: (2025)
by: Wang, Jingyao, et al.
Published: (2025)
MMRel: Benchmarking Relation Understanding in Multi-Modal Large Language Models
by: Nie, Jiahao, et al.
Published: (2024)
by: Nie, Jiahao, et al.
Published: (2024)
Learning Modality-agnostic Representation for Semantic Segmentation from Any Modalities
by: Zheng, Xu, et al.
Published: (2024)
by: Zheng, Xu, et al.
Published: (2024)
Evolving Prompt Adaptation for Vision-Language Models
by: Zhang, Enming, et al.
Published: (2026)
by: Zhang, Enming, et al.
Published: (2026)
VLMEvalKit: An Open-Source Toolkit for Evaluating Large Multi-Modality Models
by: Duan, Haodong, et al.
Published: (2024)
by: Duan, Haodong, et al.
Published: (2024)
Cobra: Extending Mamba to Multi-Modal Large Language Model for Efficient Inference
by: Zhao, Han, et al.
Published: (2024)
by: Zhao, Han, et al.
Published: (2024)
SKDF: A Simple Knowledge Distillation Framework for Distilling Open-Vocabulary Knowledge to Open-world Object Detector
by: Ma, Shuailei, et al.
Published: (2023)
by: Ma, Shuailei, et al.
Published: (2023)
u-LLaVA: Unifying Multi-Modal Tasks via Large Language Model
by: Xu, Jinjin, et al.
Published: (2023)
by: Xu, Jinjin, et al.
Published: (2023)
Modality-Aware and Shift Mixer for Multi-modal Brain Tumor Segmentation
by: Huang, Zhongzhen, et al.
Published: (2024)
by: Huang, Zhongzhen, et al.
Published: (2024)
MSD-KMamba: Bidirectional Spatial-Aware Multi-Modal 3D Brain Segmentation via Multi-scale Self-Distilled Fusion Strategy
by: Tan, Dayu, et al.
Published: (2025)
by: Tan, Dayu, et al.
Published: (2025)
Reducing Unimodal Bias in Multi-Modal Semantic Segmentation with Multi-Scale Functional Entropy Regularization
by: Zheng, Xu, et al.
Published: (2025)
by: Zheng, Xu, et al.
Published: (2025)
Empowering Segmentation Ability to Multi-modal Large Language Models
by: Yang, Yuqi, et al.
Published: (2024)
by: Yang, Yuqi, et al.
Published: (2024)
MammothModa: Multi-Modal Large Language Model
by: She, Qi, et al.
Published: (2024)
by: She, Qi, et al.
Published: (2024)
STMI: Segmentation-Guided Token Modulation with Cross-Modal Hypergraph Interaction for Multi-Modal Object Re-Identification
by: Xu, Xingguo, et al.
Published: (2026)
by: Xu, Xingguo, et al.
Published: (2026)
Similar Items
-
PopulAtion Parameter Averaging (PAPA)
by: Jolicoeur-Martineau, Alexia, et al.
Published: (2023) -
FAIL: Flow Matching Adversarial Imitation Learning for Image Generation
by: Ma, Yeyao, et al.
Published: (2026) -
First Multi-Dimensional Evaluation of Flowchart Comprehension for Multimodal Large Language Models
by: Zhang, Enming, et al.
Published: (2024) -
HAVANA: Hierarchical stochastic neighbor embedding for Accelerated Video ANnotAtions
by: Bobe, Alexandru, et al.
Published: (2024) -
View-Invariant Pixelwise Anomaly Detection in Multi-object Scenes with Adaptive View Synthesis
by: Varghese, Subin, et al.
Published: (2024)