Taxonomy-Aware Representation Alignment for Hierarchical Visual Recognition with Large Multimodal Models
Fuente:
arXiv
Salvato in:
| Autori principali: | He, Hulingxiao, Tan, Zhi, Peng, Yuxin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Fine-R1: Make Multi-modal LLMs Excel in Fine-Grained Visual Recognition by Chain-of-Thought Reasoning
di: He, Hulingxiao, et al.
Pubblicazione: (2026)
di: He, Hulingxiao, et al.
Pubblicazione: (2026)
Analyzing and Boosting the Power of Fine-Grained Visual Recognition for Multi-modal Large Language Models
di: He, Hulingxiao, et al.
Pubblicazione: (2025)
di: He, Hulingxiao, et al.
Pubblicazione: (2025)
Venus: Benchmarking and Empowering Multimodal Large Language Models for Aesthetic Guidance and Cropping
di: Du, Tianxiang, et al.
Pubblicazione: (2026)
di: Du, Tianxiang, et al.
Pubblicazione: (2026)
Unleashing the Intrinsic Visual Representation Capability of Multimodal Large Language Models
di: Li, Hengzhuang, et al.
Pubblicazione: (2025)
di: Li, Hengzhuang, et al.
Pubblicazione: (2025)
Multimodal Prompt Alignment for Facial Expression Recognition
di: Ma, Fuyan, et al.
Pubblicazione: (2025)
di: Ma, Fuyan, et al.
Pubblicazione: (2025)
AesFormer: Transform Everyday Photos into Beautiful Memories
di: Du, Tianxiang, et al.
Pubblicazione: (2026)
di: Du, Tianxiang, et al.
Pubblicazione: (2026)
Divide-and-Conquer Inference for Large-Scale Visual Recognition with Multimodal Large Language Models
di: Ye, Zhipeng, et al.
Pubblicazione: (2026)
di: Ye, Zhipeng, et al.
Pubblicazione: (2026)
BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models
di: Tang, Jianting, et al.
Pubblicazione: (2025)
di: Tang, Jianting, et al.
Pubblicazione: (2025)
S4-Driver: Scalable Self-Supervised Driving Multimodal Large Language Modelwith Spatio-Temporal Visual Representation
di: Xie, Yichen, et al.
Pubblicazione: (2025)
di: Xie, Yichen, et al.
Pubblicazione: (2025)
CountMamba: Exploring Multi-directional Selective State-Space Models for Plant Counting
di: He, Hulingxiao, et al.
Pubblicazione: (2024)
di: He, Hulingxiao, et al.
Pubblicazione: (2024)
Vision Inference Former: Sustaining Visual Consistency in Multimodal Large Language Models
di: Dong, Xinpeng, et al.
Pubblicazione: (2026)
di: Dong, Xinpeng, et al.
Pubblicazione: (2026)
DSH-Bench: A Difficulty- and Scenario-Aware Benchmark with Hierarchical Subject Taxonomy for Subject-Driven Text-to-Image Generation
di: Hu, Zhenyu, et al.
Pubblicazione: (2026)
di: Hu, Zhenyu, et al.
Pubblicazione: (2026)
Prompt-Aware Adapter: Towards Learning Adaptive Visual Tokens for Multimodal Large Language Models
di: Zhang, Yue, et al.
Pubblicazione: (2024)
di: Zhang, Yue, et al.
Pubblicazione: (2024)
PARTONOMY: Large Multimodal Models with Part-Level Visual Understanding
di: Blume, Ansel, et al.
Pubblicazione: (2025)
di: Blume, Ansel, et al.
Pubblicazione: (2025)
PaLMR: Towards Faithful Visual Reasoning via Multimodal Process Alignment
di: Li, Yantao, et al.
Pubblicazione: (2026)
di: Li, Yantao, et al.
Pubblicazione: (2026)
Survey of Large Multimodal Model Datasets, Application Categories and Taxonomy
di: Pattnayak, Priyaranjan, et al.
Pubblicazione: (2024)
di: Pattnayak, Priyaranjan, et al.
Pubblicazione: (2024)
Visual-Noise Guided In-Context Distillation for Multimodal Large Language Model Unlearning
di: Chen, Junkai, et al.
Pubblicazione: (2026)
di: Chen, Junkai, et al.
Pubblicazione: (2026)
TDATR: Improving End-to-End Table Recognition via Table Detail-Aware Learning and Cell-Level Visual Alignment
di: Qin, Chunxia, et al.
Pubblicazione: (2026)
di: Qin, Chunxia, et al.
Pubblicazione: (2026)
MIAR: Modality Interaction and Alignment Representation Fuison for Multimodal Emotion
di: Zhu, Jichao, et al.
Pubblicazione: (2026)
di: Zhu, Jichao, et al.
Pubblicazione: (2026)
Parameter-Efficient Fine-Tuning Medical Multimodal Large Language Models for Medical Visual Grounding
di: He, Jinlong, et al.
Pubblicazione: (2024)
di: He, Jinlong, et al.
Pubblicazione: (2024)
Advancing Multimodal Large Language Models with Quantization-Aware Scale Learning for Efficient Adaptation
di: Xie, Jingjing, et al.
Pubblicazione: (2024)
di: Xie, Jingjing, et al.
Pubblicazione: (2024)
IDRL: An Individual-Aware Multimodal Depression-Related Representation Learning Framework for Depression Diagnosis
di: Wang, Chongxiao, et al.
Pubblicazione: (2026)
di: Wang, Chongxiao, et al.
Pubblicazione: (2026)
Alignment-Aware and Reliability-Gated Multimodal Fusion for Unmanned Aerial Vehicle Detection Across Heterogeneous Thermal-Visual Sensors
di: Jahan, Ishrat, et al.
Pubblicazione: (2026)
di: Jahan, Ishrat, et al.
Pubblicazione: (2026)
MetaCOG: A Hierarchical Probabilistic Model for Learning Meta-Cognitive Visual Representations
di: Berke, Marlene D., et al.
Pubblicazione: (2021)
di: Berke, Marlene D., et al.
Pubblicazione: (2021)
HierarchicalPrune: Position-Aware Compression for Large-Scale Diffusion Models
di: Kwon, Young D., et al.
Pubblicazione: (2025)
di: Kwon, Young D., et al.
Pubblicazione: (2025)
Tangram: Benchmark for Evaluating Geometric Element Recognition in Large Multimodal Models
di: Zhang, Chao, et al.
Pubblicazione: (2024)
di: Zhang, Chao, et al.
Pubblicazione: (2024)
MM-Instruct: Generated Visual Instructions for Large Multimodal Model Alignment
di: Liu, Jihao, et al.
Pubblicazione: (2024)
di: Liu, Jihao, et al.
Pubblicazione: (2024)
AgriBench: A Hierarchical Agriculture Benchmark for Multimodal Large Language Models
di: Zhou, Yutong, et al.
Pubblicazione: (2024)
di: Zhou, Yutong, et al.
Pubblicazione: (2024)
Benchmarking Large Multimodal Models for Ophthalmic Visual Question Answering with OphthalWeChat
di: Xu, Pusheng, et al.
Pubblicazione: (2025)
di: Xu, Pusheng, et al.
Pubblicazione: (2025)
LaViC: Adapting Large Vision-Language Models to Visually-Aware Conversational Recommendation
di: Jeon, Hyunsik, et al.
Pubblicazione: (2025)
di: Jeon, Hyunsik, et al.
Pubblicazione: (2025)
Demystifying the Visual Quality Paradox in Multimodal Large Language Models
di: Xing, Shuo, et al.
Pubblicazione: (2025)
di: Xing, Shuo, et al.
Pubblicazione: (2025)
AdaTok: Adaptive Token Compression with Object-Aware Representations for Efficient Multimodal LLMs
di: Zhang, Xinliang, et al.
Pubblicazione: (2025)
di: Zhang, Xinliang, et al.
Pubblicazione: (2025)
Benchmarking Multimodal Large Language Models for Face Recognition
di: Shahreza, Hatef Otroshi, et al.
Pubblicazione: (2025)
di: Shahreza, Hatef Otroshi, et al.
Pubblicazione: (2025)
DuoFormer: Leveraging Hierarchical Visual Representations by Local and Global Attention
di: Tang, Xiaoya, et al.
Pubblicazione: (2024)
di: Tang, Xiaoya, et al.
Pubblicazione: (2024)
Visual Graph Arena: Evaluating Visual Conceptualization of Vision and Multimodal Large Language Models
di: Babaiee, Zahra, et al.
Pubblicazione: (2025)
di: Babaiee, Zahra, et al.
Pubblicazione: (2025)
Gramian Multimodal Representation Learning and Alignment
di: Cicchetti, Giordano, et al.
Pubblicazione: (2024)
di: Cicchetti, Giordano, et al.
Pubblicazione: (2024)
Fill the GAP: A Granular Alignment Paradigm for Visual Reasoning in Multimodal Large Language Models
di: Miao, Yanting, et al.
Pubblicazione: (2026)
di: Miao, Yanting, et al.
Pubblicazione: (2026)
Large Language Model Guided Progressive Feature Alignment for Multimodal UAV Object Detection
di: Wu, Wentao, et al.
Pubblicazione: (2025)
di: Wu, Wentao, et al.
Pubblicazione: (2025)
Hierarchical Hypercomplex Network for Multimodal Emotion Recognition
di: Lopez, Eleonora, et al.
Pubblicazione: (2024)
di: Lopez, Eleonora, et al.
Pubblicazione: (2024)
Hierarchical Semantic Correlation-Aware Masked Autoencoder for Unsupervised Audio-Visual Representation Learning
di: Zeng, Donghuo, et al.
Pubblicazione: (2026)
di: Zeng, Donghuo, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Fine-R1: Make Multi-modal LLMs Excel in Fine-Grained Visual Recognition by Chain-of-Thought Reasoning
di: He, Hulingxiao, et al.
Pubblicazione: (2026) -
Analyzing and Boosting the Power of Fine-Grained Visual Recognition for Multi-modal Large Language Models
di: He, Hulingxiao, et al.
Pubblicazione: (2025) -
Venus: Benchmarking and Empowering Multimodal Large Language Models for Aesthetic Guidance and Cropping
di: Du, Tianxiang, et al.
Pubblicazione: (2026) -
Unleashing the Intrinsic Visual Representation Capability of Multimodal Large Language Models
di: Li, Hengzhuang, et al.
Pubblicazione: (2025) -
Multimodal Prompt Alignment for Facial Expression Recognition
di: Ma, Fuyan, et al.
Pubblicazione: (2025)