Photon: Speedup Volume Understanding with Efficient Multimodal Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Fang, Chengyu, Guo, Heng, Jiang, Zheng, He, Chunming, Li, Xiu, Xu, Minfeng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MedVR: Annotation-Free Medical Visual Reasoning via Agentic Reinforcement Learning
di: Jiang, Zheng, et al.
Pubblicazione: (2026)
di: Jiang, Zheng, et al.
Pubblicazione: (2026)
Diffusion Models in Low-Level Vision: A Survey
di: He, Chunming, et al.
Pubblicazione: (2024)
di: He, Chunming, et al.
Pubblicazione: (2024)
MOSABench: Multi-Object Sentiment Analysis Benchmark for Evaluating Multimodal Large Language Models Understanding of Complex Image
di: Song, Shezheng, et al.
Pubblicazione: (2024)
di: Song, Shezheng, et al.
Pubblicazione: (2024)
Cognitive Mismatch in Multimodal Large Language Models for Discrete Symbol Understanding
di: Li, Yinghui, et al.
Pubblicazione: (2026)
di: Li, Yinghui, et al.
Pubblicazione: (2026)
A Survey of Camouflaged Object Detection and Beyond
di: Xiao, Fengyang, et al.
Pubblicazione: (2024)
di: Xiao, Fengyang, et al.
Pubblicazione: (2024)
Efficient Multimodal Large Language Models: A Survey
di: Jin, Yizhang, et al.
Pubblicazione: (2024)
di: Jin, Yizhang, et al.
Pubblicazione: (2024)
UnfoldLDM: Degradation-Aware Unfolding with Iterative Latent Diffusion Priors for Blind Image Restoration
di: He, Chunming, et al.
Pubblicazione: (2025)
di: He, Chunming, et al.
Pubblicazione: (2025)
PARTONOMY: Large Multimodal Models with Part-Level Visual Understanding
di: Blume, Ansel, et al.
Pubblicazione: (2025)
di: Blume, Ansel, et al.
Pubblicazione: (2025)
Benchmarking Pathology Foundation Models for Spatial Domain Understanding
di: Zhao, Bokai, et al.
Pubblicazione: (2026)
di: Zhao, Bokai, et al.
Pubblicazione: (2026)
Toward Cognitive Supersensing in Multimodal Large Language Model
di: Li, Boyi, et al.
Pubblicazione: (2026)
di: Li, Boyi, et al.
Pubblicazione: (2026)
Benchmarking Egocentric Clinical Intent Understanding Capability for Medical Multimodal Large Language Models
di: Liu, Shaonan, et al.
Pubblicazione: (2026)
di: Liu, Shaonan, et al.
Pubblicazione: (2026)
Can Multimodal Large Language Models Truly Understand Small Objects?
di: Han, Fujun, et al.
Pubblicazione: (2026)
di: Han, Fujun, et al.
Pubblicazione: (2026)
Parameter-Efficient Fine-Tuning Medical Multimodal Large Language Models for Medical Visual Grounding
di: He, Jinlong, et al.
Pubblicazione: (2024)
di: He, Jinlong, et al.
Pubblicazione: (2024)
TextHawk: Exploring Efficient Fine-Grained Perception of Multimodal Large Language Models
di: Yu, Ya-Qi, et al.
Pubblicazione: (2024)
di: Yu, Ya-Qi, et al.
Pubblicazione: (2024)
NoiseBoost: Alleviating Hallucination with Noise Perturbation for Multimodal Large Language Models
di: Wu, Kai, et al.
Pubblicazione: (2024)
di: Wu, Kai, et al.
Pubblicazione: (2024)
Q-Zoom: Query-Aware Adaptive Perception for Efficient Multimodal Large Language Models
di: Shi, Yuheng, et al.
Pubblicazione: (2026)
di: Shi, Yuheng, et al.
Pubblicazione: (2026)
Reversible Unfolding Network for Concealed Visual Perception with Generative Refinement
di: He, Chunming, et al.
Pubblicazione: (2025)
di: He, Chunming, et al.
Pubblicazione: (2025)
VidLaDA: Bidirectional Diffusion Large Language Models for Efficient Video Understanding
di: He, Zhihao, et al.
Pubblicazione: (2026)
di: He, Zhihao, et al.
Pubblicazione: (2026)
Apollo: An Exploration of Video Understanding in Large Multimodal Models
di: Zohar, Orr, et al.
Pubblicazione: (2024)
di: Zohar, Orr, et al.
Pubblicazione: (2024)
COUNTS: Benchmarking Object Detectors and Multimodal Large Language Models under Distribution Shifts
di: Li, Jiansheng, et al.
Pubblicazione: (2025)
di: Li, Jiansheng, et al.
Pubblicazione: (2025)
AgriChat: A Multimodal Large Language Model for Agriculture Image Understanding
di: Boudiaf, Abderrahmene, et al.
Pubblicazione: (2026)
di: Boudiaf, Abderrahmene, et al.
Pubblicazione: (2026)
EventVL: Understand Event Streams via Multimodal Large Language Model
di: Li, Pengteng, et al.
Pubblicazione: (2025)
di: Li, Pengteng, et al.
Pubblicazione: (2025)
UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding
di: Xu, Chenkai, et al.
Pubblicazione: (2025)
di: Xu, Chenkai, et al.
Pubblicazione: (2025)
Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models
di: Zhan, Yufei, et al.
Pubblicazione: (2025)
di: Zhan, Yufei, et al.
Pubblicazione: (2025)
Xmodel-VLM: A Simple Baseline for Multimodal Vision Language Model
di: Xu, Wanting, et al.
Pubblicazione: (2024)
di: Xu, Wanting, et al.
Pubblicazione: (2024)
II-Bench: An Image Implication Understanding Benchmark for Multimodal Large Language Models
di: Liu, Ziqiang, et al.
Pubblicazione: (2024)
di: Liu, Ziqiang, et al.
Pubblicazione: (2024)
Sparse Shortcuts: Facilitating Efficient Fusion in Multimodal Large Language Models
di: Zhang, Jingrui, et al.
Pubblicazione: (2026)
di: Zhang, Jingrui, et al.
Pubblicazione: (2026)
AndesVL Technical Report: An Efficient Mobile-side Multimodal Large Language Model
di: Jin, Zhiwei, et al.
Pubblicazione: (2025)
di: Jin, Zhiwei, et al.
Pubblicazione: (2025)
A Large-Scale Multimodal Dataset and Benchmarks for Human Activity Scene Understanding and Reasoning
di: Jiang, Siyang, et al.
Pubblicazione: (2025)
di: Jiang, Siyang, et al.
Pubblicazione: (2025)
Adversarial Prompt Injection Attack on Multimodal Large Language Models
di: Ding, Meiwen, et al.
Pubblicazione: (2026)
di: Ding, Meiwen, et al.
Pubblicazione: (2026)
RxnBench: A Multimodal Benchmark for Evaluating Large Language Models on Chemical Reaction Understanding from Scientific Literature
di: Li, Hanzheng, et al.
Pubblicazione: (2025)
di: Li, Hanzheng, et al.
Pubblicazione: (2025)
On the Out-Of-Distribution Generalization of Multimodal Large Language Models
di: Zhang, Xingxuan, et al.
Pubblicazione: (2024)
di: Zhang, Xingxuan, et al.
Pubblicazione: (2024)
Strategic Preys Make Acute Predators: Enhancing Camouflaged Object Detectors by Generating Camouflaged Objects
di: He, Chunming, et al.
Pubblicazione: (2023)
di: He, Chunming, et al.
Pubblicazione: (2023)
MME-Emotion: A Holistic Evaluation Benchmark for Emotional Intelligence in Multimodal Large Language Models
di: Zhang, Fan, et al.
Pubblicazione: (2025)
di: Zhang, Fan, et al.
Pubblicazione: (2025)
Understanding vs. Generation: Navigating Optimization Dilemma in Multimodal Models
di: Ye, Sen, et al.
Pubblicazione: (2026)
di: Ye, Sen, et al.
Pubblicazione: (2026)
Model Composition for Multimodal Large Language Models
di: Chen, Chi, et al.
Pubblicazione: (2024)
di: Chen, Chi, et al.
Pubblicazione: (2024)
See&Trek: Training-Free Spatial Prompting for Multimodal Large Language Model
di: Li, Pengteng, et al.
Pubblicazione: (2025)
di: Li, Pengteng, et al.
Pubblicazione: (2025)
SurgMLLMBench: A Multimodal Large Language Model Benchmark Dataset for Surgical Scene Understanding
di: Choi, Tae-Min, et al.
Pubblicazione: (2025)
di: Choi, Tae-Min, et al.
Pubblicazione: (2025)
Tokenization Allows Multimodal Large Language Models to Understand, Generate and Edit Architectural Floor Plans
di: Qin, Sizhong, et al.
Pubblicazione: (2026)
di: Qin, Sizhong, et al.
Pubblicazione: (2026)
Scaling the Long Video Understanding of Multimodal Large Language Models via Visual Memory Mechanism
di: Chen, Tao, et al.
Pubblicazione: (2026)
di: Chen, Tao, et al.
Pubblicazione: (2026)
Documenti analoghi
-
MedVR: Annotation-Free Medical Visual Reasoning via Agentic Reinforcement Learning
di: Jiang, Zheng, et al.
Pubblicazione: (2026) -
Diffusion Models in Low-Level Vision: A Survey
di: He, Chunming, et al.
Pubblicazione: (2024) -
MOSABench: Multi-Object Sentiment Analysis Benchmark for Evaluating Multimodal Large Language Models Understanding of Complex Image
di: Song, Shezheng, et al.
Pubblicazione: (2024) -
Cognitive Mismatch in Multimodal Large Language Models for Discrete Symbol Understanding
di: Li, Yinghui, et al.
Pubblicazione: (2026) -
A Survey of Camouflaged Object Detection and Beyond
di: Xiao, Fengyang, et al.
Pubblicazione: (2024)