ShizhenGPT: Towards Multimodal LLMs for Traditional Chinese Medicine
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Junying, Cai, Zhenyang, Liu, Zhiheng, Yang, Yunjin, Wang, Rongsheng, Xiao, Qingying, Feng, Xiangyi, Su, Zhan, Guo, Jing, Wan, Xiang, Yu, Guangjun, Li, Haizhou, Wang, Benyou |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Can Multimodal LLMs See Materials Clearly? A Multimodal Benchmark on Materials Characterization
par: Lai, Zhengzhao, et autres
Publié: (2025)
par: Lai, Zhengzhao, et autres
Publié: (2025)
LongLLaVA: Scaling Multi-modal LLMs to 1000 Images Efficiently via a Hybrid Architecture
par: Wang, Xidong, et autres
Publié: (2024)
par: Wang, Xidong, et autres
Publié: (2024)
MedGen: Unlocking Medical Video Generation by Scaling Granularly-annotated Medical Videos
par: Wang, Rongsheng, et autres
Publié: (2025)
par: Wang, Rongsheng, et autres
Publié: (2025)
ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation
par: Chen, Junying, et autres
Publié: (2025)
par: Chen, Junying, et autres
Publié: (2025)
HuatuoGPT-o1, Towards Medical Complex Reasoning with LLMs
par: Chen, Junying, et autres
Publié: (2024)
par: Chen, Junying, et autres
Publié: (2024)
TCC-Bench: Benchmarking the Traditional Chinese Culture Understanding Capabilities of MLLMs
par: Xu, Pengju, et autres
Publié: (2025)
par: Xu, Pengju, et autres
Publié: (2025)
Less is More: A Simple yet Effective Token Reduction Method for Efficient Multi-modal LLMs
par: Song, Dingjie, et autres
Publié: (2024)
par: Song, Dingjie, et autres
Publié: (2024)
HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale
par: Chen, Junying, et autres
Publié: (2024)
par: Chen, Junying, et autres
Publié: (2024)
Both Text and Images Leaked! A Systematic Analysis of Data Contamination in Multimodal LLM
par: Song, Dingjie, et autres
Publié: (2024)
par: Song, Dingjie, et autres
Publié: (2024)
Facilitating Daily Practice in Intangible Cultural Heritage through Virtual Reality: A Case Study of Traditional Chinese Flower Arrangement
par: Wang, Yingna, et autres
Publié: (2025)
par: Wang, Yingna, et autres
Publié: (2025)
BenCao: An Instruction-Tuned Large Language Model for Traditional Chinese Medicine
par: Xie, Jiacheng, et autres
Publié: (2025)
par: Xie, Jiacheng, et autres
Publié: (2025)
GalleryGPT: Analyzing Paintings with Large Multimodal Models
par: Bin, Yi, et autres
Publié: (2024)
par: Bin, Yi, et autres
Publié: (2024)
ArchGPT: Understanding the World's Architectures with Large Multimodal Models
par: Wang, Yuze, et autres
Publié: (2025)
par: Wang, Yuze, et autres
Publié: (2025)
Exploring Compositional Generalization of Multimodal LLMs for Medical Imaging
par: Cai, Zhenyang, et autres
Publié: (2024)
par: Cai, Zhenyang, et autres
Publié: (2024)
Do LLMs Triage Like Clinicians? A Dynamic Study of Outpatient Referral
par: Liu, Xiaoxiao, et autres
Publié: (2025)
par: Liu, Xiaoxiao, et autres
Publié: (2025)
Multimodal Large Language Models for Medicine: A Comprehensive Survey
par: Ye, Jiarui, et autres
Publié: (2025)
par: Ye, Jiarui, et autres
Publié: (2025)
AV-Odyssey Bench: Can Your Multimodal LLMs Really Understand Audio-Visual Information?
par: Gong, Kaixiong, et autres
Publié: (2024)
par: Gong, Kaixiong, et autres
Publié: (2024)
Can't See the Forest for the Trees: Benchmarking Multimodal Safety Awareness for Multimodal LLMs
par: Wang, Wenxuan, et autres
Publié: (2025)
par: Wang, Wenxuan, et autres
Publié: (2025)
OralGPT-Omni: A Versatile Dental Multimodal Large Language Model
par: Hao, Jing, et autres
Publié: (2025)
par: Hao, Jing, et autres
Publié: (2025)
Evolutionary Multimodal Reasoning via Hierarchical Semantic Representation for Intent Recognition
par: Zhou, Qianrui, et autres
Publié: (2026)
par: Zhou, Qianrui, et autres
Publié: (2026)
MIntRec2.0: A Large-scale Benchmark Dataset for Multimodal Intent Recognition and Out-of-scope Detection in Conversations
par: Zhang, Hanlei, et autres
Publié: (2024)
par: Zhang, Hanlei, et autres
Publié: (2024)
Retrieval-Augmented Multimodal Model for Fake News Detection
par: Li, Yiheng, et autres
Publié: (2026)
par: Li, Yiheng, et autres
Publié: (2026)
Listening to the Unspoken: Exploring "365" Aspects of Multimodal Interview Performance Assessment
par: Li, Jia, et autres
Publié: (2025)
par: Li, Jia, et autres
Publié: (2025)
TimeLens: Rethinking Video Temporal Grounding with Multimodal LLMs
par: Zhang, Jun, et autres
Publié: (2025)
par: Zhang, Jun, et autres
Publié: (2025)
Dynamic Multimodal Expression Generation for LLM-Driven Pedagogical Agents: From User Experience Perspective
par: Wan, Ninghao, et autres
Publié: (2026)
par: Wan, Ninghao, et autres
Publié: (2026)
GuardAlign: Test-time Safety Alignment in Multimodal Large Language Models
par: Zhu, Xingyu, et autres
Publié: (2026)
par: Zhu, Xingyu, et autres
Publié: (2026)
Towards Aligning Multimodal LLMs with Human Experts: A Focus on Parent-Child Interaction
par: Shi, Weiyan, et autres
Publié: (2025)
par: Shi, Weiyan, et autres
Publié: (2025)
When Drawing Is Not Enough: Exploring Spontaneous Speech with Sketch for Intent Alignment in Multimodal LLMs
par: Shi, Weiyan, et autres
Publié: (2026)
par: Shi, Weiyan, et autres
Publié: (2026)
Enrich and Detect: Video Temporal Grounding with Multimodal LLMs
par: Pramanick, Shraman, et autres
Publié: (2025)
par: Pramanick, Shraman, et autres
Publié: (2025)
UMETTS: A Unified Framework for Emotional Text-to-Speech Synthesis with Multimodal Prompts
par: Cheng, Zhi-Qi, et autres
Publié: (2024)
par: Cheng, Zhi-Qi, et autres
Publié: (2024)
RealBench: A Chinese Multi-image Understanding Benchmark Close to Real-world Scenarios
par: Zhao, Fei, et autres
Publié: (2025)
par: Zhao, Fei, et autres
Publié: (2025)
Empowering Multimodal LLMs with External Tools: A Comprehensive Survey
par: An, Wenbin, et autres
Publié: (2025)
par: An, Wenbin, et autres
Publié: (2025)
TCAN: Text-oriented Cross Attention Network for Multimodal Sentiment Analysis
par: Quan, Weize, et autres
Publié: (2024)
par: Quan, Weize, et autres
Publié: (2024)
Parallel Vision Token Scheduling for Fast and Accurate Multimodal LMMs Inference
par: Zhan, Wengyi, et autres
Publié: (2025)
par: Zhan, Wengyi, et autres
Publié: (2025)
Remember Past, Anticipate Future: Learning Continual Multimodal Misinformation Detectors
par: Wang, Bing, et autres
Publié: (2025)
par: Wang, Bing, et autres
Publié: (2025)
MMESGBench: Pioneering Multimodal Understanding and Complex Reasoning Benchmark for ESG Tasks
par: Zhang, Lei, et autres
Publié: (2025)
par: Zhang, Lei, et autres
Publié: (2025)
Distilling Implicit Multimodal Knowledge into Large Language Models for Zero-Resource Dialogue Generation
par: Zhang, Bo, et autres
Publié: (2024)
par: Zhang, Bo, et autres
Publié: (2024)
CMATH: Cross-Modality Augmented Transformer with Hierarchical Variational Distillation for Multimodal Emotion Recognition in Conversation
par: Zhu, Xiaofei, et autres
Publié: (2024)
par: Zhu, Xiaofei, et autres
Publié: (2024)
Holistic Evaluation of Multimodal LLMs on Spatial Intelligence
par: Cai, Zhongang, et autres
Publié: (2025)
par: Cai, Zhongang, et autres
Publié: (2025)
ShieldVLM: Safeguarding the Multimodal Implicit Toxicity via Deliberative Reasoning with LVLMs
par: Cui, Shiyao, et autres
Publié: (2025)
par: Cui, Shiyao, et autres
Publié: (2025)
Documents similaires
-
Can Multimodal LLMs See Materials Clearly? A Multimodal Benchmark on Materials Characterization
par: Lai, Zhengzhao, et autres
Publié: (2025) -
LongLLaVA: Scaling Multi-modal LLMs to 1000 Images Efficiently via a Hybrid Architecture
par: Wang, Xidong, et autres
Publié: (2024) -
MedGen: Unlocking Medical Video Generation by Scaling Granularly-annotated Medical Videos
par: Wang, Rongsheng, et autres
Publié: (2025) -
ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation
par: Chen, Junying, et autres
Publié: (2025) -
HuatuoGPT-o1, Towards Medical Complex Reasoning with LLMs
par: Chen, Junying, et autres
Publié: (2024)