AviationLMM: A Large Multimodal Foundation Model for Civil Aviation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Wenbin, Wu, Jingling, Chen, Xiaoyong Lin. Jing, Chen, Cong |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MangaVQA and MangaLMM: A Benchmark and Specialized Model for Multimodal Manga Understanding
par: Baek, Jeonghun, et autres
Publié: (2025)
par: Baek, Jeonghun, et autres
Publié: (2025)
Toward Robust Multimodal Learning using Multimodal Foundational Models
par: Zhao, Xianbing, et autres
Publié: (2024)
par: Zhao, Xianbing, et autres
Publié: (2024)
LMM-PCQA: Assisting Point Cloud Quality Assessment with LMM
par: Zhang, Zicheng, et autres
Publié: (2024)
par: Zhang, Zicheng, et autres
Publié: (2024)
LMM-VQA: Advancing Video Quality Assessment with Large Multimodal Models
par: Ge, Qihang, et autres
Publié: (2024)
par: Ge, Qihang, et autres
Publié: (2024)
PatentLMM: Large Multimodal Model for Generating Descriptions for Patent Figures
par: Shukla, Shreya, et autres
Publié: (2025)
par: Shukla, Shreya, et autres
Publié: (2025)
SPD-Faith Bench: Diagnosing and Improving Faithfulness in Chain-of-Thought for Multimodal Large Language Models
par: Lv, Weijiang, et autres
Publié: (2026)
par: Lv, Weijiang, et autres
Publié: (2026)
VisualAgentBench: Towards Large Multimodal Models as Visual Foundation Agents
par: Liu, Xiao, et autres
Publié: (2024)
par: Liu, Xiao, et autres
Publié: (2024)
Model Composition for Multimodal Large Language Models
par: Chen, Chi, et autres
Publié: (2024)
par: Chen, Chi, et autres
Publié: (2024)
Graphic Design with Large Multimodal Model
par: Cheng, Yutao, et autres
Publié: (2024)
par: Cheng, Yutao, et autres
Publié: (2024)
LatteCLIP: Unsupervised CLIP Fine-Tuning via LMM-Synthetic Texts
par: Cao, Anh-Quan, et autres
Publié: (2024)
par: Cao, Anh-Quan, et autres
Publié: (2024)
Muffin or Chihuahua? Challenging Multimodal Large Language Models with Multipanel VQA
par: Fan, Yue, et autres
Publié: (2024)
par: Fan, Yue, et autres
Publié: (2024)
Lingshu: A Generalist Foundation Model for Unified Multimodal Medical Understanding and Reasoning
par: LASA Team, et autres
Publié: (2025)
par: LASA Team, et autres
Publié: (2025)
Large Multimodal Agents: A Survey
par: Xie, Junlin, et autres
Publié: (2024)
par: Xie, Junlin, et autres
Publié: (2024)
Mavors: Multi-granularity Video Representation for Multimodal Large Language Model
par: Shi, Yang, et autres
Publié: (2025)
par: Shi, Yang, et autres
Publié: (2025)
Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models
par: Ding, Meidan, et autres
Publié: (2025)
par: Ding, Meidan, et autres
Publié: (2025)
A Survey on Agentic Multimodal Large Language Models
par: Yao, Huanjin, et autres
Publié: (2025)
par: Yao, Huanjin, et autres
Publié: (2025)
Mitigating Object Hallucinations in Large Vision-Language Models with Assembly of Global and Local Attention
par: An, Wenbin, et autres
Publié: (2024)
par: An, Wenbin, et autres
Publié: (2024)
OceanPile: A Large-Scale Multimodal Ocean Corpus for Foundation Models
par: Xue, Yida, et autres
Publié: (2026)
par: Xue, Yida, et autres
Publié: (2026)
TOMATO: Assessing Visual Temporal Reasoning Capabilities in Multimodal Foundation Models
par: Shangguan, Ziyao, et autres
Publié: (2024)
par: Shangguan, Ziyao, et autres
Publié: (2024)
ScratchEval: Are GPT-4o Smarter than My Child? Evaluating Large Multimodal Models with Visual Programming Challenges
par: Fu, Rao, et autres
Publié: (2024)
par: Fu, Rao, et autres
Publié: (2024)
RestoreAgent: Autonomous Image Restoration Agent via Multimodal Large Language Models
par: Chen, Haoyu, et autres
Publié: (2024)
par: Chen, Haoyu, et autres
Publié: (2024)
Xuanwu: Evolving General Multimodal Models into an Industrial-Grade Foundation for Content Ecosystems
par: Zhang, Zhiqian, et autres
Publié: (2026)
par: Zhang, Zhiqian, et autres
Publié: (2026)
VideoAutoArena: An Automated Arena for Evaluating Large Multimodal Models in Video Analysis through User Simulation
par: Luo, Ziyang, et autres
Publié: (2024)
par: Luo, Ziyang, et autres
Publié: (2024)
II-Bench: An Image Implication Understanding Benchmark for Multimodal Large Language Models
par: Liu, Ziqiang, et autres
Publié: (2024)
par: Liu, Ziqiang, et autres
Publié: (2024)
BLINK: Multimodal Large Language Models Can See but Not Perceive
par: Fu, Xingyu, et autres
Publié: (2024)
par: Fu, Xingyu, et autres
Publié: (2024)
SIRR-LMM: Single-image Reflection Removal via Large Multimodal Model
par: Guo, Yu, et autres
Publié: (2026)
par: Guo, Yu, et autres
Publié: (2026)
Make-it-Real: Unleashing Large Multimodal Model for Painting 3D Objects with Realistic Materials
par: Fang, Ye, et autres
Publié: (2024)
par: Fang, Ye, et autres
Publié: (2024)
IW-Bench: Evaluating Large Multimodal Models for Converting Image-to-Web
par: Guo, Hongcheng, et autres
Publié: (2024)
par: Guo, Hongcheng, et autres
Publié: (2024)
PDF-WuKong: A Large Multimodal Model for Efficient Long PDF Reading with End-to-End Sparse Sampling
par: Xie, Xudong, et autres
Publié: (2024)
par: Xie, Xudong, et autres
Publié: (2024)
StreetviewLLM: Extracting Geographic Information Using a Chain-of-Thought Multimodal Large Language Model
par: Li, Zongrong, et autres
Publié: (2024)
par: Li, Zongrong, et autres
Publié: (2024)
Migician: Revealing the Magic of Free-Form Multi-Image Grounding in Multimodal Large Language Models
par: Li, You, et autres
Publié: (2025)
par: Li, You, et autres
Publié: (2025)
TangramPuzzle: Evaluating Multimodal Large Language Models with Compositional Spatial Reasoning
par: Liu, Daixian, et autres
Publié: (2026)
par: Liu, Daixian, et autres
Publié: (2026)
Multimodal Foundation Models Exploit Text to Make Medical Image Predictions
par: Buckley, Thomas, et autres
Publié: (2023)
par: Buckley, Thomas, et autres
Publié: (2023)
LFTR: Learning-Free Token Reduction for Multimodal Large Language Models
par: Zhao, Zihui, et autres
Publié: (2025)
par: Zhao, Zihui, et autres
Publié: (2025)
MM-Vet v2: A Challenging Benchmark to Evaluate Large Multimodal Models for Integrated Capabilities
par: Yu, Weihao, et autres
Publié: (2024)
par: Yu, Weihao, et autres
Publié: (2024)
Many-Shot In-Context Learning in Multimodal Foundation Models
par: Jiang, Yixing, et autres
Publié: (2024)
par: Jiang, Yixing, et autres
Publié: (2024)
Robust Multimodal Large Language Models Against Modality Conflict
par: Zhang, Zongmeng, et autres
Publié: (2025)
par: Zhang, Zongmeng, et autres
Publié: (2025)
Benchmarking Egocentric Clinical Intent Understanding Capability for Medical Multimodal Large Language Models
par: Liu, Shaonan, et autres
Publié: (2026)
par: Liu, Shaonan, et autres
Publié: (2026)
Rethinking Visual Prompting for Multimodal Large Language Models with External Knowledge
par: Lin, Yuanze, et autres
Publié: (2024)
par: Lin, Yuanze, et autres
Publié: (2024)
MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency
par: Jiang, Dongzhi, et autres
Publié: (2025)
par: Jiang, Dongzhi, et autres
Publié: (2025)
Documents similaires
-
MangaVQA and MangaLMM: A Benchmark and Specialized Model for Multimodal Manga Understanding
par: Baek, Jeonghun, et autres
Publié: (2025) -
Toward Robust Multimodal Learning using Multimodal Foundational Models
par: Zhao, Xianbing, et autres
Publié: (2024) -
LMM-PCQA: Assisting Point Cloud Quality Assessment with LMM
par: Zhang, Zicheng, et autres
Publié: (2024) -
LMM-VQA: Advancing Video Quality Assessment with Large Multimodal Models
par: Ge, Qihang, et autres
Publié: (2024) -
PatentLMM: Large Multimodal Model for Generating Descriptions for Patent Figures
par: Shukla, Shreya, et autres
Publié: (2025)