Achieving Fine-grained Cross-modal Understanding through Brain-inspired Hierarchical Representation Learning
Fuente:
arXiv
Guardado en:
| Autores principales: | You, Weihang, Jiang, Hanqi, Pan, Yi, Chen, Junhao, Liu, Tianming, Dou, Fei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Neural Functional Alignment Space: Brain-Referenced Representation of Artificial Neural Networks
por: Yan, Ruiyu, et al.
Publicado: (2026)
por: Yan, Ruiyu, et al.
Publicado: (2026)
OracleSage: Towards Unified Visual-Linguistic Understanding of Oracle Bone Scripts through Cross-Modal Knowledge Fusion
por: Jiang, Hanqi, et al.
Publicado: (2024)
por: Jiang, Hanqi, et al.
Publicado: (2024)
ViThinker: Active Vision-Language Reasoning via Dynamic Perceptual Querying
por: You, Weihang, et al.
Publicado: (2026)
por: You, Weihang, et al.
Publicado: (2026)
ContextGuard-LVLM: Enhancing News Veracity through Fine-grained Cross-modal Contextual Consistency Verification
por: Ma, Sihan, et al.
Publicado: (2025)
por: Ma, Sihan, et al.
Publicado: (2025)
MARAuder's Map: Motion-Aware Real-time Activity Recognition with Layout-Based Trajectories
por: Liu, Zishuai, et al.
Publicado: (2025)
por: Liu, Zishuai, et al.
Publicado: (2025)
AdCare-VLM: Towards a Unified and Pre-aligned Latent Representation for Healthcare Video Understanding
por: Jabin, Md Asaduzzaman, et al.
Publicado: (2025)
por: Jabin, Md Asaduzzaman, et al.
Publicado: (2025)
FineCLIPER: Multi-modal Fine-grained CLIP for Dynamic Facial Expression Recognition with AdaptERs
por: Chen, Haodong, et al.
Publicado: (2024)
por: Chen, Haodong, et al.
Publicado: (2024)
Cross-modal Full-mode Fine-grained Alignment for Text-to-Image Person Retrieval
por: Yin, Hao, et al.
Publicado: (2025)
por: Yin, Hao, et al.
Publicado: (2025)
Multi-modal Reference Learning for Fine-grained Text-to-Image Retrieval
por: Ma, Zehong, et al.
Publicado: (2025)
por: Ma, Zehong, et al.
Publicado: (2025)
Fine-grained Background Representation for Weakly Supervised Semantic Segmentation
por: Yin, Xu, et al.
Publicado: (2024)
por: Yin, Xu, et al.
Publicado: (2024)
CrossVideo: Self-supervised Cross-modal Contrastive Learning for Point Cloud Video Understanding
por: Liu, Yunze, et al.
Publicado: (2024)
por: Liu, Yunze, et al.
Publicado: (2024)
Advancing Medical Radiograph Representation Learning: A Hybrid Pre-training Paradigm with Multilevel Semantic Granularity
por: Jiang, Hanqi, et al.
Publicado: (2024)
por: Jiang, Hanqi, et al.
Publicado: (2024)
MA-Bench: Towards Fine-grained Micro-Action Understanding
por: Li, Kun, et al.
Publicado: (2026)
por: Li, Kun, et al.
Publicado: (2026)
Hierarchical Cross-modal Prompt Learning for Vision-Language Models
por: Zheng, Hao, et al.
Publicado: (2025)
por: Zheng, Hao, et al.
Publicado: (2025)
PixCLIP: Achieving Fine-grained Visual Language Understanding via Any-granularity Pixel-Text Alignment Learning
por: Xiao, Yicheng, et al.
Publicado: (2025)
por: Xiao, Yicheng, et al.
Publicado: (2025)
Video Compression with Hierarchical Temporal Neural Representation
por: Zhu, Jun, et al.
Publicado: (2026)
por: Zhu, Jun, et al.
Publicado: (2026)
Multi-modal Representations for Fine-grained Multi-label Critical View of Safety Recognition
por: Baby, Britty, et al.
Publicado: (2025)
por: Baby, Britty, et al.
Publicado: (2025)
Thinking with Gaze: Sequential Eye-Tracking as Visual Reasoning Supervision for Medical VLMs
por: Li, Yiwei, et al.
Publicado: (2026)
por: Li, Yiwei, et al.
Publicado: (2026)
Learning Brain Representation with Hierarchical Visual Embeddings
por: Zheng, Jiawen, et al.
Publicado: (2026)
por: Zheng, Jiawen, et al.
Publicado: (2026)
FineRS: Fine-grained Reasoning and Segmentation of Small Objects with Reinforcement Learning
por: Zhang, Lu, et al.
Publicado: (2025)
por: Zhang, Lu, et al.
Publicado: (2025)
Multi-modal Instruction Tuned LLMs with Fine-grained Visual Perception
por: He, Junwen, et al.
Publicado: (2024)
por: He, Junwen, et al.
Publicado: (2024)
Open Eyes, Then Reason: Fine-grained Visual Mathematical Understanding in MLLMs
por: Zhang, Shan, et al.
Publicado: (2025)
por: Zhang, Shan, et al.
Publicado: (2025)
A Unified Hierarchical Framework for Fine-grained Cross-view Geo-localization over Large-scale Scenarios
por: Song, Zhuo, et al.
Publicado: (2025)
por: Song, Zhuo, et al.
Publicado: (2025)
Fine-grained Multiple Supervisory Network for Multi-modal Manipulation Detecting and Grounding
por: Yu, Xinquan, et al.
Publicado: (2025)
por: Yu, Xinquan, et al.
Publicado: (2025)
MMHead: Towards Fine-grained Multi-modal 3D Facial Animation
por: Wu, Sijing, et al.
Publicado: (2024)
por: Wu, Sijing, et al.
Publicado: (2024)
UniFine: A Unified and Fine-grained Approach for Zero-shot Vision-Language Understanding
por: Wang, Zhecan, et al.
Publicado: (2023)
por: Wang, Zhecan, et al.
Publicado: (2023)
GaussianCross: Cross-modal Self-supervised 3D Representation Learning via Gaussian Splatting
por: Yao, Lei, et al.
Publicado: (2025)
por: Yao, Lei, et al.
Publicado: (2025)
Learning Coarse-to-Fine Osteoarthritis Representations under Noisy Hierarchical Labels
por: Zhang, Tongxu
Publicado: (2026)
por: Zhang, Tongxu
Publicado: (2026)
Distractors-Immune Representation Learning with Cross-modal Contrastive Regularization for Change Captioning
por: Tu, Yunbin, et al.
Publicado: (2024)
por: Tu, Yunbin, et al.
Publicado: (2024)
CADFormer: Fine-Grained Cross-modal Alignment and Decoding Transformer for Referring Remote Sensing Image Segmentation
por: Liu, Maofu, et al.
Publicado: (2025)
por: Liu, Maofu, et al.
Publicado: (2025)
Towards Fine-grained Renal Vasculature Segmentation: Full-Scale Hierarchical Learning with FH-Seg
por: Long, Yitian, et al.
Publicado: (2025)
por: Long, Yitian, et al.
Publicado: (2025)
Cross-Hierarchical Bidirectional Consistency Learning for Fine-Grained Visual Classification
por: Gao, Pengxiang, et al.
Publicado: (2025)
por: Gao, Pengxiang, et al.
Publicado: (2025)
Fine-grained Context and Multi-modal Alignment for Freehand 3D Ultrasound Reconstruction
por: Yan, Zhongnuo, et al.
Publicado: (2024)
por: Yan, Zhongnuo, et al.
Publicado: (2024)
MFCLIP: Multi-modal Fine-grained CLIP for Generalizable Diffusion Face Forgery Detection
por: Zhang, Yaning, et al.
Publicado: (2024)
por: Zhang, Yaning, et al.
Publicado: (2024)
Fine-grained Image Retrieval via Dual-Vision Adaptation
por: Jiang, Xin, et al.
Publicado: (2025)
por: Jiang, Xin, et al.
Publicado: (2025)
Test-time Distribution Learning Adapter for Cross-modal Visual Reasoning
por: Zhang, Yi, et al.
Publicado: (2024)
por: Zhang, Yi, et al.
Publicado: (2024)
Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation
por: Chen, Harold Haodong, et al.
Publicado: (2025)
por: Chen, Harold Haodong, et al.
Publicado: (2025)
HiVG: Hierarchical Multimodal Fine-grained Modulation for Visual Grounding
por: Xiao, Linhui, et al.
Publicado: (2024)
por: Xiao, Linhui, et al.
Publicado: (2024)
Language-guided Hierarchical Fine-grained Image Forgery Detection and Localization
por: Guo, Xiao, et al.
Publicado: (2024)
por: Guo, Xiao, et al.
Publicado: (2024)
ICFNet: Integrated Cross-modal Fusion Network for Survival Prediction
por: Zhang, Binyu, et al.
Publicado: (2025)
por: Zhang, Binyu, et al.
Publicado: (2025)
Ejemplares similares
-
Neural Functional Alignment Space: Brain-Referenced Representation of Artificial Neural Networks
por: Yan, Ruiyu, et al.
Publicado: (2026) -
OracleSage: Towards Unified Visual-Linguistic Understanding of Oracle Bone Scripts through Cross-Modal Knowledge Fusion
por: Jiang, Hanqi, et al.
Publicado: (2024) -
ViThinker: Active Vision-Language Reasoning via Dynamic Perceptual Querying
por: You, Weihang, et al.
Publicado: (2026) -
ContextGuard-LVLM: Enhancing News Veracity through Fine-grained Cross-modal Contextual Consistency Verification
por: Ma, Sihan, et al.
Publicado: (2025) -
MARAuder's Map: Motion-Aware Real-time Activity Recognition with Layout-Based Trajectories
por: Liu, Zishuai, et al.
Publicado: (2025)