Cross Modal Fine-Grained Alignment via Granularity-Aware and Region-Uncertain Modeling
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Jiale, Zhou, Haoming, Liu, Yishu, Chen, Bingzhi, Jiang, Yuncheng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
PixCLIP: Achieving Fine-grained Visual Language Understanding via Any-granularity Pixel-Text Alignment Learning
di: Xiao, Yicheng, et al.
Pubblicazione: (2025)
di: Xiao, Yicheng, et al.
Pubblicazione: (2025)
Cross-Modal and Uni-Modal Soft-Label Alignment for Image-Text Retrieval
di: Huang, Hailang, et al.
Pubblicazione: (2024)
di: Huang, Hailang, et al.
Pubblicazione: (2024)
Teacher-Guided Pseudo Supervision and Cross-Modal Alignment for Audio-Visual Video Parsing
di: Chen, Yaru, et al.
Pubblicazione: (2025)
di: Chen, Yaru, et al.
Pubblicazione: (2025)
ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
di: Zhang, Zhenxing, et al.
Pubblicazione: (2024)
di: Zhang, Zhenxing, et al.
Pubblicazione: (2024)
Deciphering Personalization: Towards Fine-Grained Explainability in Natural Language for Personalized Image Generation Models
di: Wang, Haoming, et al.
Pubblicazione: (2025)
di: Wang, Haoming, et al.
Pubblicazione: (2025)
Signal: Selective Interaction and Global-local Alignment for Multi-Modal Object Re-Identification
di: Liu, Yangyang, et al.
Pubblicazione: (2025)
di: Liu, Yangyang, et al.
Pubblicazione: (2025)
Exploring Mutual Cross-Modal Attention for Context-Aware Human Affordance Generation
di: Roy, Prasun, et al.
Pubblicazione: (2025)
di: Roy, Prasun, et al.
Pubblicazione: (2025)
MSCT: Differential Cross-Modal Attention for Deepfake Detection
di: Wei, Fangda, et al.
Pubblicazione: (2026)
di: Wei, Fangda, et al.
Pubblicazione: (2026)
Multi-Modal Cross-Domain Alignment Network for Video Moment Retrieval
di: Fang, Xiang, et al.
Pubblicazione: (2022)
di: Fang, Xiang, et al.
Pubblicazione: (2022)
Art2Mus: Artwork-to-Music Generation via Visual Conditioning and Large-Scale Cross-Modal Alignment
di: Rinaldi, Ivan, et al.
Pubblicazione: (2026)
di: Rinaldi, Ivan, et al.
Pubblicazione: (2026)
CL2CM: Improving Cross-Lingual Cross-Modal Retrieval via Cross-Lingual Knowledge Transfer
di: Wang, Yabing, et al.
Pubblicazione: (2023)
di: Wang, Yabing, et al.
Pubblicazione: (2023)
Dual-Granularity Cross-Modal Identity Association for Weakly-Supervised Text-to-Person Image Matching
di: Zhang, Yafei, et al.
Pubblicazione: (2025)
di: Zhang, Yafei, et al.
Pubblicazione: (2025)
DVF: Advancing Robust and Accurate Fine-Grained Image Retrieval with Retrieval Guidelines
di: Jiang, Xin, et al.
Pubblicazione: (2024)
di: Jiang, Xin, et al.
Pubblicazione: (2024)
MIRROR: Multi-Modal Pathological Self-Supervised Representation Learning via Modality Alignment and Retention
di: Wang, Tianyi, et al.
Pubblicazione: (2025)
di: Wang, Tianyi, et al.
Pubblicazione: (2025)
Learning Contrastive Self-Distillation for Ultra-Fine-Grained Visual Categorization Targeting Limited Samples
di: Fang, Ziye, et al.
Pubblicazione: (2023)
di: Fang, Ziye, et al.
Pubblicazione: (2023)
HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning
di: Chen, Liyang, et al.
Pubblicazione: (2025)
di: Chen, Liyang, et al.
Pubblicazione: (2025)
SkeFi: Cross-Modal Knowledge Transfer for Wireless Skeleton-Based Action Recognition
di: Huang, Shunyu, et al.
Pubblicazione: (2026)
di: Huang, Shunyu, et al.
Pubblicazione: (2026)
Wavelet-Decoupling Contrastive Enhancement Network for Fine-Grained Skeleton-Based Action Recognition
di: Chang, Haochen, et al.
Pubblicazione: (2024)
di: Chang, Haochen, et al.
Pubblicazione: (2024)
LongInsightBench: A Comprehensive Benchmark for Evaluating Omni-Modal Models on Human-Centric Long-Video Understanding
di: Han, ZhaoYang, et al.
Pubblicazione: (2025)
di: Han, ZhaoYang, et al.
Pubblicazione: (2025)
Hypergraph Tversky-Aware Domain Incremental Learning for Brain Tumor Segmentation with Missing Modalities
di: Wang, Junze, et al.
Pubblicazione: (2025)
di: Wang, Junze, et al.
Pubblicazione: (2025)
AlignVSR: Audio-Visual Cross-Modal Alignment for Visual Speech Recognition
di: Liu, Zehua, et al.
Pubblicazione: (2024)
di: Liu, Zehua, et al.
Pubblicazione: (2024)
Modality Gap-Driven Subspace Alignment Training Paradigm For Multimodal Large Language Models
di: Yu, Xiaomin, et al.
Pubblicazione: (2026)
di: Yu, Xiaomin, et al.
Pubblicazione: (2026)
BiTDiff: Fine-Grained 3D Conducting Motion Generation via BiMamba-Transformer Diffusion
di: Jia, Tianzhi, et al.
Pubblicazione: (2026)
di: Jia, Tianzhi, et al.
Pubblicazione: (2026)
Fine-grained Image Retrieval via Dual-Vision Adaptation
di: Jiang, Xin, et al.
Pubblicazione: (2025)
di: Jiang, Xin, et al.
Pubblicazione: (2025)
CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation
di: Hao, Haihong, et al.
Pubblicazione: (2025)
di: Hao, Haihong, et al.
Pubblicazione: (2025)
Modality-Aware Shot Relating and Comparing for Video Scene Detection
di: Tan, Jiawei, et al.
Pubblicazione: (2024)
di: Tan, Jiawei, et al.
Pubblicazione: (2024)
SNIFR : Boosting Fine-Grained Child Harmful Content Detection Through Audio-Visual Alignment with Cascaded Cross-Transformer
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2025)
di: Phukan, Orchid Chetia, et al.
Pubblicazione: (2025)
SkyLink: Unifying Street-Satellite Geo-Localization via UAV-Mediated 3D Scene Alignment
di: Zhang, Hongyang, et al.
Pubblicazione: (2025)
di: Zhang, Hongyang, et al.
Pubblicazione: (2025)
Robust Self-Paced Hashing for Cross-Modal Retrieval with Noisy Labels
di: Pu, Ruitao, et al.
Pubblicazione: (2025)
di: Pu, Ruitao, et al.
Pubblicazione: (2025)
G4G:A Generic Framework for High Fidelity Talking Face Generation with Fine-grained Intra-modal Alignment
di: Zhang, Juan, et al.
Pubblicazione: (2024)
di: Zhang, Juan, et al.
Pubblicazione: (2024)
Towards Unbiased Cross-Modal Representation Learning for Food Image-to-Recipe Retrieval
di: Wang, Qing, et al.
Pubblicazione: (2025)
di: Wang, Qing, et al.
Pubblicazione: (2025)
Towards Identity-Aware Cross-Modal Retrieval: a Dataset and a Baseline
di: Messina, Nicola, et al.
Pubblicazione: (2024)
di: Messina, Nicola, et al.
Pubblicazione: (2024)
GeoLink: A 3D-Aware Framework Towards Better Generalization in Cross-View Geo-Localization
di: Zhang, Hongyang, et al.
Pubblicazione: (2026)
di: Zhang, Hongyang, et al.
Pubblicazione: (2026)
Multi-scale Activation, Refinement, and Aggregation: Exploring Diverse Cues for Fine-Grained Bird Recognition
di: Zhang, Zhicheng, et al.
Pubblicazione: (2025)
di: Zhang, Zhicheng, et al.
Pubblicazione: (2025)
Joint Explicit and Implicit Cross-Modal Interaction Network for Anterior Chamber Inflammation Diagnosis
di: Shao, Qian, et al.
Pubblicazione: (2023)
di: Shao, Qian, et al.
Pubblicazione: (2023)
HeGraphAdapter: Tuning Multi-Modal Vision-Language Models with Heterogeneous Graph Adapter
di: Zhao, Yumiao, et al.
Pubblicazione: (2024)
di: Zhao, Yumiao, et al.
Pubblicazione: (2024)
Provably Secure Robust Image Steganography via Cross-Modal Error Correction
di: Qi, Yuang, et al.
Pubblicazione: (2024)
di: Qi, Yuang, et al.
Pubblicazione: (2024)
Spatial-Aware Efficient Projector for MLLMs via Multi-Layer Feature Aggregation
di: Qian, Shun, et al.
Pubblicazione: (2024)
di: Qian, Shun, et al.
Pubblicazione: (2024)
Efficient Vision Language Model Fine-tuning for Text-based Person Anomaly Search
di: He, Jiayi, et al.
Pubblicazione: (2025)
di: He, Jiayi, et al.
Pubblicazione: (2025)
PetalView: Fine-grained Location and Orientation Extraction of Street-view Images via Cross-view Local Search with Supplementary Materials
di: Hu, Wenmiao, et al.
Pubblicazione: (2024)
di: Hu, Wenmiao, et al.
Pubblicazione: (2024)
Documenti analoghi
-
PixCLIP: Achieving Fine-grained Visual Language Understanding via Any-granularity Pixel-Text Alignment Learning
di: Xiao, Yicheng, et al.
Pubblicazione: (2025) -
Cross-Modal and Uni-Modal Soft-Label Alignment for Image-Text Retrieval
di: Huang, Hailang, et al.
Pubblicazione: (2024) -
Teacher-Guided Pseudo Supervision and Cross-Modal Alignment for Audio-Visual Video Parsing
di: Chen, Yaru, et al.
Pubblicazione: (2025) -
ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
di: Zhang, Zhenxing, et al.
Pubblicazione: (2024) -
Deciphering Personalization: Towards Fine-Grained Explainability in Natural Language for Personalized Image Generation Models
di: Wang, Haoming, et al.
Pubblicazione: (2025)