MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces
Fuente:
arXiv
Salvato in:
| Autori principali: | E, Shaojun, Yang, Yuchen, Wu, Jiaheng, Zhang, Yan, Zhao, Tiejun, Chen, Ziyan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing
di: Zhao, Pengcheng, et al.
Pubblicazione: (2024)
di: Zhao, Pengcheng, et al.
Pubblicazione: (2024)
AV-Edit: Multimodal Generative Sound Effect Editing via Audio-Visual Semantic Joint Control
di: Guo, Xinyue, et al.
Pubblicazione: (2025)
di: Guo, Xinyue, et al.
Pubblicazione: (2025)
DeepSPG: Exploring Deep Semantic Prior Guidance for Low-light Image Enhancement with Multimodal Learning
di: Lu, Jialang, et al.
Pubblicazione: (2025)
di: Lu, Jialang, et al.
Pubblicazione: (2025)
Unbiased Video Scene Graph Generation via Visual and Semantic Dual Debiasing
di: Li, Yanjun, et al.
Pubblicazione: (2025)
di: Li, Yanjun, et al.
Pubblicazione: (2025)
ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
di: Zhang, Zhenxing, et al.
Pubblicazione: (2024)
di: Zhang, Zhenxing, et al.
Pubblicazione: (2024)
Visual Semantic Description Generation with MLLMs for Image-Text Matching
di: Chen, Junyu, et al.
Pubblicazione: (2025)
di: Chen, Junyu, et al.
Pubblicazione: (2025)
GSE: Evaluating Sticker Visual Semantic Similarity via a General Sticker Encoder
di: Chee, Heng Er Metilda, et al.
Pubblicazione: (2025)
di: Chee, Heng Er Metilda, et al.
Pubblicazione: (2025)
Dual Attribute-Spatial Relation Alignment for 3D Visual Grounding
di: Xu, Yue, et al.
Pubblicazione: (2024)
di: Xu, Yue, et al.
Pubblicazione: (2024)
Identity-Preserving Text-to-Video Generation via Training-Free Prompt, Image, and Guidance Enhancement
di: Gao, Jiayi, et al.
Pubblicazione: (2025)
di: Gao, Jiayi, et al.
Pubblicazione: (2025)
AGSP-DSA: An Adaptive Graph Signal Processing Framework for Robust Multimodal Fusion with Dynamic Semantic Alignment
di: Karthikeya, KV, et al.
Pubblicazione: (2026)
di: Karthikeya, KV, et al.
Pubblicazione: (2026)
UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation
di: Chen, Yanzhe, et al.
Pubblicazione: (2025)
di: Chen, Yanzhe, et al.
Pubblicazione: (2025)
Can Multimodal Large Language Models Understand Spatial Relations?
di: Liu, Jingping, et al.
Pubblicazione: (2025)
di: Liu, Jingping, et al.
Pubblicazione: (2025)
PixCLIP: Achieving Fine-grained Visual Language Understanding via Any-granularity Pixel-Text Alignment Learning
di: Xiao, Yicheng, et al.
Pubblicazione: (2025)
di: Xiao, Yicheng, et al.
Pubblicazione: (2025)
Vision as a Dialect: Unifying Visual Understanding and Generation via Text-Aligned Representations
di: Han, Jiaming, et al.
Pubblicazione: (2025)
di: Han, Jiaming, et al.
Pubblicazione: (2025)
StableDub: Taming Diffusion Prior for Generalized and Efficient Visual Dubbing
di: Chen, Liyang, et al.
Pubblicazione: (2025)
di: Chen, Liyang, et al.
Pubblicazione: (2025)
VMAS: Video-to-Music Generation via Semantic Alignment in Web Music Videos
di: Lin, Yan-Bo, et al.
Pubblicazione: (2024)
di: Lin, Yan-Bo, et al.
Pubblicazione: (2024)
Teacher-Guided Pseudo Supervision and Cross-Modal Alignment for Audio-Visual Video Parsing
di: Chen, Yaru, et al.
Pubblicazione: (2025)
di: Chen, Yaru, et al.
Pubblicazione: (2025)
Bridging Your Imagination with Audio-Video Generation via a Unified Director
di: Zhang, Jiaxu, et al.
Pubblicazione: (2025)
di: Zhang, Jiaxu, et al.
Pubblicazione: (2025)
Bridging the Pose-Semantic Gap: A Cascade Framework for Text-Based Person Anomaly Search
di: Xie, Zequn, et al.
Pubblicazione: (2026)
di: Xie, Zequn, et al.
Pubblicazione: (2026)
OS-HGAdapter: Open Semantic Hypergraph Adapter for Large Language Models Assisted Entropy-Enhanced Image-Text Alignment
di: Chen, Rongjun, et al.
Pubblicazione: (2025)
di: Chen, Rongjun, et al.
Pubblicazione: (2025)
UniCVR: From Alignment to Reranking for Unified Zero-Shot Composed Visual Retrieval
di: Wen, Haokun, et al.
Pubblicazione: (2026)
di: Wen, Haokun, et al.
Pubblicazione: (2026)
VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting
di: Ilaslan, Muhammet Furkan, et al.
Pubblicazione: (2024)
di: Ilaslan, Muhammet Furkan, et al.
Pubblicazione: (2024)
Art2Mus: Artwork-to-Music Generation via Visual Conditioning and Large-Scale Cross-Modal Alignment
di: Rinaldi, Ivan, et al.
Pubblicazione: (2026)
di: Rinaldi, Ivan, et al.
Pubblicazione: (2026)
G4G:A Generic Framework for High Fidelity Talking Face Generation with Fine-grained Intra-modal Alignment
di: Zhang, Juan, et al.
Pubblicazione: (2024)
di: Zhang, Juan, et al.
Pubblicazione: (2024)
Enhanced Multimodal Hate Video Detection via Channel-wise and Modality-wise Fusion
di: Zhang, Yinghui, et al.
Pubblicazione: (2025)
di: Zhang, Yinghui, et al.
Pubblicazione: (2025)
MindTuner: Cross-Subject Visual Decoding with Visual Fingerprint and Semantic Correction
di: Gong, Zixuan, et al.
Pubblicazione: (2024)
di: Gong, Zixuan, et al.
Pubblicazione: (2024)
A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation
di: Zhou, S. Z., et al.
Pubblicazione: (2025)
di: Zhou, S. Z., et al.
Pubblicazione: (2025)
FreeEnhance: Tuning-Free Image Enhancement via Content-Consistent Noising-and-Denoising Process
di: Luo, Yang, et al.
Pubblicazione: (2024)
di: Luo, Yang, et al.
Pubblicazione: (2024)
VP3D: Unleashing 2D Visual Prompt for Text-to-3D Generation
di: Chen, Yang, et al.
Pubblicazione: (2024)
di: Chen, Yang, et al.
Pubblicazione: (2024)
TRUST-VL: An Explainable News Assistant for General Multimodal Misinformation Detection
di: Yan, Zehong, et al.
Pubblicazione: (2025)
di: Yan, Zehong, et al.
Pubblicazione: (2025)
GuardAlign: Test-time Safety Alignment in Multimodal Large Language Models
di: Zhu, Xingyu, et al.
Pubblicazione: (2026)
di: Zhu, Xingyu, et al.
Pubblicazione: (2026)
LAPIG: Language Guided Projector Image Generation with Surface Adaptation and Stylization
di: Deng, Yuchen, et al.
Pubblicazione: (2025)
di: Deng, Yuchen, et al.
Pubblicazione: (2025)
Multimodal Large Language Model is a Human-Aligned Annotator for Text-to-Image Generation
di: Wu, Xun, et al.
Pubblicazione: (2024)
di: Wu, Xun, et al.
Pubblicazione: (2024)
HOP: Heterogeneous Topology-based Multimodal Entanglement for Co-Speech Gesture Generation
di: Cheng, Hongye, et al.
Pubblicazione: (2025)
di: Cheng, Hongye, et al.
Pubblicazione: (2025)
Semantically Consistent Person Image Generation
di: Roy, Prasun, et al.
Pubblicazione: (2023)
di: Roy, Prasun, et al.
Pubblicazione: (2023)
Cross Modal Fine-Grained Alignment via Granularity-Aware and Region-Uncertain Modeling
di: Liu, Jiale, et al.
Pubblicazione: (2025)
di: Liu, Jiale, et al.
Pubblicazione: (2025)
Calibrated Multimodal Representation Learning with Missing Modalities
di: Liu, Xiaohao, et al.
Pubblicazione: (2025)
di: Liu, Xiaohao, et al.
Pubblicazione: (2025)
MultiSoundGen: Video-to-Audio Generation for Multi-Event Scenarios via SlowFast Contrastive Audio-Visual Pretraining and Direct Preference Optimization
di: Yang, Jianxuan, et al.
Pubblicazione: (2025)
di: Yang, Jianxuan, et al.
Pubblicazione: (2025)
AdaptaGen: Domain-Specific Image Generation through Hierarchical Semantic Optimization Framework
di: Zhang, Suoxiang, et al.
Pubblicazione: (2025)
di: Zhang, Suoxiang, et al.
Pubblicazione: (2025)
Advancing Grounded Multimodal Named Entity Recognition via LLM-Based Reformulation and Box-Based Segmentation
di: Li, Jinyuan, et al.
Pubblicazione: (2024)
di: Li, Jinyuan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing
di: Zhao, Pengcheng, et al.
Pubblicazione: (2024) -
AV-Edit: Multimodal Generative Sound Effect Editing via Audio-Visual Semantic Joint Control
di: Guo, Xinyue, et al.
Pubblicazione: (2025) -
DeepSPG: Exploring Deep Semantic Prior Guidance for Low-light Image Enhancement with Multimodal Learning
di: Lu, Jialang, et al.
Pubblicazione: (2025) -
Unbiased Video Scene Graph Generation via Visual and Semantic Dual Debiasing
di: Li, Yanjun, et al.
Pubblicazione: (2025) -
ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
di: Zhang, Zhenxing, et al.
Pubblicazione: (2024)