Advancing Fine-Grained Visual Understanding with Multi-Scale Alignment in Multi-Modal Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Wei, Li, Zhaowei, Xu, Qi, Li, Linfeng, Cai, YiQing, Jiang, Botian, Song, Hang, Hu, Xingcan, Wang, Pengyu, Xiao, Li |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
UnifiedMLLM: Enabling Unified Representation for Multi-modal Multi-tasks With Large Language Model
par: Li, Zhaowei, et autres
Publié: (2024)
par: Li, Zhaowei, et autres
Publié: (2024)
FCN-LLM: Empower LLM for Brain Functional Connectivity Network Understanding via Graph-level Multi-task Instruction Tuning
par: Hu, Xingcan, et autres
Publié: (2026)
par: Hu, Xingcan, et autres
Publié: (2026)
SpeechAgents: Human-Communication Simulation with Multi-Modal Multi-Agent Systems
par: Zhang, Dong, et autres
Publié: (2024)
par: Zhang, Dong, et autres
Publié: (2024)
Decoupled Proxy Alignment: Mitigating Language Prior Conflict for Multimodal Alignment in MLLM
par: Tan, Chenkun, et autres
Publié: (2025)
par: Tan, Chenkun, et autres
Publié: (2025)
Attenuation of LHAASO PeVatrons by Interstellar Radiation Field and Cosmic Microwave Background Radiation
par: Zhang, Jianli, et autres
Publié: (2024)
par: Zhang, Jianli, et autres
Publié: (2024)
Understanding the Role of LLMs in Multimodal Evaluation Benchmarks
par: Jiang, Botian, et autres
Publié: (2024)
par: Jiang, Botian, et autres
Publié: (2024)
Neural Collapse in Multi-label Learning with Pick-all-label Loss
par: Li, Pengyu, et autres
Publié: (2023)
par: Li, Pengyu, et autres
Publié: (2023)
UnifiedVisual: A Framework for Constructing Unified Vision-Language Datasets
par: Wang, Pengyu, et autres
Publié: (2025)
par: Wang, Pengyu, et autres
Publié: (2025)
CoF: Coarse to Fine-Grained Image Understanding for Multi-modal Large Language Models
par: Wang, Yeyuan, et autres
Publié: (2024)
par: Wang, Yeyuan, et autres
Publié: (2024)
FireSentry: A Multi-Modal Spatio-temporal Benchmark Dataset for Fine-Grained Wildfire Spread Forecasting
par: Zhou, Nan, et autres
Publié: (2025)
par: Zhou, Nan, et autres
Publié: (2025)
FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL
par: Pan, Kaihang, et autres
Publié: (2025)
par: Pan, Kaihang, et autres
Publié: (2025)
Mixture-of-Modality-Experts with Holistic Token Learning for Fine-Grained Multimodal Visual Analytics in Driver Action Recognition
par: Liu, Tianyi, et autres
Publié: (2026)
par: Liu, Tianyi, et autres
Publié: (2026)
Learning 3D Medical Image Models From Brain Functional Connectivity Network Supervision For Mental Disorder Diagnosis
par: Hu, Xingcan, et autres
Publié: (2025)
par: Hu, Xingcan, et autres
Publié: (2025)
TAMO: Fine-Grained Root Cause Analysis via Tool-Assisted LLM Agent with Multi-Modality Observation Data in Cloud-Native Systems
par: Zhang, Xiao, et autres
Publié: (2025)
par: Zhang, Xiao, et autres
Publié: (2025)
Medical Image Synthesis via Fine-Grained Image-Text Alignment and Anatomy-Pathology Prompting
par: Chen, Wenting, et autres
Publié: (2024)
par: Chen, Wenting, et autres
Publié: (2024)
Cross-Level Multi-Instance Distillation for Self-Supervised Fine-Grained Visual Categorization
par: Bi, Qi, et autres
Publié: (2024)
par: Bi, Qi, et autres
Publié: (2024)
MERIT: Multilingual Semantic Retrieval with Interleaved Multi-Condition Query
par: Chow, Wei, et autres
Publié: (2025)
par: Chow, Wei, et autres
Publié: (2025)
InferAligner: Inference-Time Alignment for Harmlessness through Cross-Model Guidance
par: Wang, Pengyu, et autres
Publié: (2024)
par: Wang, Pengyu, et autres
Publié: (2024)
Visual-Oriented Fine-Grained Knowledge Editing for MultiModal Large Language Models
par: Zeng, Zhen, et autres
Publié: (2024)
par: Zeng, Zhen, et autres
Publié: (2024)
FG-CLIP: Fine-Grained Visual and Textual Alignment
par: Xie, Chunyu, et autres
Publié: (2025)
par: Xie, Chunyu, et autres
Publié: (2025)
MM-Mixing: Multi-Modal Mixing Alignment for 3D Understanding
par: Wang, Jiaze, et autres
Publié: (2024)
par: Wang, Jiaze, et autres
Publié: (2024)
Visual CoT: Advancing Multi-Modal Language Models with a Comprehensive Dataset and Benchmark for Chain-of-Thought Reasoning
par: Shao, Hao, et autres
Publié: (2024)
par: Shao, Hao, et autres
Publié: (2024)
RA-SSU: Towards Fine-Grained Audio-Visual Learning with Region-Aware Sound Source Understanding
par: Sun, Muyi, et autres
Publié: (2026)
par: Sun, Muyi, et autres
Publié: (2026)
GroundingGPT:Language Enhanced Multi-modal Grounding Model
par: Li, Zhaowei, et autres
Publié: (2024)
par: Li, Zhaowei, et autres
Publié: (2024)
MergeMix: A Unified Augmentation Paradigm for Visual and Multi-Modal Understanding
par: Jin, Xin, et autres
Publié: (2025)
par: Jin, Xin, et autres
Publié: (2025)
Enhancing Open-Vocabulary Object Detection through Multi-Level Fine-Grained Visual-Language Alignment
par: Zhang, Tianyi, et autres
Publié: (2026)
par: Zhang, Tianyi, et autres
Publié: (2026)
UniSumEval: Towards Unified, Fine-Grained, Multi-Dimensional Summarization Evaluation for LLMs
par: Lee, Yuho, et autres
Publié: (2024)
par: Lee, Yuho, et autres
Publié: (2024)
CMP: Cooperative Motion Prediction with Multi-Agent Communication
par: Wang, Zehao, et autres
Publié: (2024)
par: Wang, Zehao, et autres
Publié: (2024)
QCRD: Quality-guided Contrastive Rationale Distillation for Large Language Models
par: Wang, Wei, et autres
Publié: (2024)
par: Wang, Wei, et autres
Publié: (2024)
Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding
par: Li, Zhimin, et autres
Publié: (2024)
par: Li, Zhimin, et autres
Publié: (2024)
Exploration of Class Center for Fine-Grained Visual Classification
par: Yao, Hang, et autres
Publié: (2024)
par: Yao, Hang, et autres
Publié: (2024)
AutoGUI-v2: A Comprehensive Multi-Modal GUI Functionality Understanding Benchmark
par: Li, Hongxin, et autres
Publié: (2026)
par: Li, Hongxin, et autres
Publié: (2026)
AlignVSR: Audio-Visual Cross-Modal Alignment for Visual Speech Recognition
par: Liu, Zehua, et autres
Publié: (2024)
par: Liu, Zehua, et autres
Publié: (2024)
ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
par: Zhang, Zhenxing, et autres
Publié: (2024)
par: Zhang, Zhenxing, et autres
Publié: (2024)
MM-LIMA: Less Is More for Alignment in Multi-Modal Datasets
par: Wei, Lai, et autres
Publié: (2023)
par: Wei, Lai, et autres
Publié: (2023)
ModalChorus: Visual Probing and Alignment of Multi-modal Embeddings via Modal Fusion Map
par: Ye, Yilin, et autres
Publié: (2024)
par: Ye, Yilin, et autres
Publié: (2024)
CLII: Visual-Text Inpainting via Cross-Modal Predictive Interaction
par: Zhao, Liang, et autres
Publié: (2024)
par: Zhao, Liang, et autres
Publié: (2024)
Exploring Fine-Grained Image-Text Alignment for Referring Remote Sensing Image Segmentation
par: Lei, Sen, et autres
Publié: (2024)
par: Lei, Sen, et autres
Publié: (2024)
From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition
par: Liu, Yu, et autres
Publié: (2025)
par: Liu, Yu, et autres
Publié: (2025)
Multi-Modal Self-Supervised Semantic Communication
par: Zhao, Hang, et autres
Publié: (2025)
par: Zhao, Hang, et autres
Publié: (2025)
Documents similaires
-
UnifiedMLLM: Enabling Unified Representation for Multi-modal Multi-tasks With Large Language Model
par: Li, Zhaowei, et autres
Publié: (2024) -
FCN-LLM: Empower LLM for Brain Functional Connectivity Network Understanding via Graph-level Multi-task Instruction Tuning
par: Hu, Xingcan, et autres
Publié: (2026) -
SpeechAgents: Human-Communication Simulation with Multi-Modal Multi-Agent Systems
par: Zhang, Dong, et autres
Publié: (2024) -
Decoupled Proxy Alignment: Mitigating Language Prior Conflict for Multimodal Alignment in MLLM
par: Tan, Chenkun, et autres
Publié: (2025) -
Attenuation of LHAASO PeVatrons by Interstellar Radiation Field and Cosmic Microwave Background Radiation
par: Zhang, Jianli, et autres
Publié: (2024)