Guardado en:
| Autores principales: | Ye, Jiarui, Tang, Hao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2504.21051 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Large Language Models for Computer-Aided Design: A Survey
por: Zhang, Licheng, et al.
Publicado: (2025)
por: Zhang, Licheng, et al.
Publicado: (2025)
Self-Comparison for Dataset-Level Membership Inference in Large (Vision-)Language Models
por: Ren, Jie, et al.
Publicado: (2024)
por: Ren, Jie, et al.
Publicado: (2024)
ChemDFM-X: Towards Large Multimodal Model for Chemistry
por: Zhao, Zihan, et al.
Publicado: (2024)
por: Zhao, Zihan, et al.
Publicado: (2024)
Doctor Sun: A Bilingual Multimodal Large Language Model for Biomedical AI
por: Xue, Dong, et al.
Publicado: (2025)
por: Xue, Dong, et al.
Publicado: (2025)
Accelerating Multimodal Large Language Models via Dynamic Visual-Token Exit and the Empirical Findings
por: Wu, Qiong, et al.
Publicado: (2024)
por: Wu, Qiong, et al.
Publicado: (2024)
Sample then Identify: A General Framework for Risk Control and Assessment in Multimodal Large Language Models
por: Wang, Qingni, et al.
Publicado: (2024)
por: Wang, Qingni, et al.
Publicado: (2024)
RAP: Retrieval-Augmented Personalization for Multimodal Large Language Models
por: Hao, Haoran, et al.
Publicado: (2024)
por: Hao, Haoran, et al.
Publicado: (2024)
KMMMU: Evaluation of Massive Multi-discipline Multimodal Understanding in Korean Language and Context
por: Lee, Nahyun, et al.
Publicado: (2026)
por: Lee, Nahyun, et al.
Publicado: (2026)
Automating Steering for Safe Multimodal Large Language Models
por: Wu, Lyucheng, et al.
Publicado: (2025)
por: Wu, Lyucheng, et al.
Publicado: (2025)
Unified Hallucination Detection for Multimodal Large Language Models
por: Chen, Xiang, et al.
Publicado: (2024)
por: Chen, Xiang, et al.
Publicado: (2024)
Training Data Efficiency in Multimodal Process Reward Models
por: Li, Jinyuan, et al.
Publicado: (2026)
por: Li, Jinyuan, et al.
Publicado: (2026)
Can We Edit Multimodal Large Language Models?
por: Cheng, Siyuan, et al.
Publicado: (2023)
por: Cheng, Siyuan, et al.
Publicado: (2023)
Test-Time Backdoor Attacks on Multimodal Large Language Models
por: Lu, Dong, et al.
Publicado: (2024)
por: Lu, Dong, et al.
Publicado: (2024)
MemeCLIP: Leveraging CLIP Representations for Multimodal Meme Classification
por: Shah, Siddhant Bikram, et al.
Publicado: (2024)
por: Shah, Siddhant Bikram, et al.
Publicado: (2024)
DLF: Disentangled-Language-Focused Multimodal Sentiment Analysis
por: Wang, Pan, et al.
Publicado: (2024)
por: Wang, Pan, et al.
Publicado: (2024)
Dental-TriageBench: Benchmarking Multimodal Reasoning for Hierarchical Dental Triage
por: He, Ziyi, et al.
Publicado: (2026)
por: He, Ziyi, et al.
Publicado: (2026)
StreaMulT: Streaming Multimodal Transformer for Heterogeneous and Arbitrary Long Sequential Data
por: Pellegrain, Victor, et al.
Publicado: (2021)
por: Pellegrain, Victor, et al.
Publicado: (2021)
Argus Inspection: Do Multimodal Large Language Models Possess the Eye of Panoptes?
por: Yao, Yang, et al.
Publicado: (2025)
por: Yao, Yang, et al.
Publicado: (2025)
ShizhenGPT: Towards Multimodal LLMs for Traditional Chinese Medicine
por: Chen, Junying, et al.
Publicado: (2025)
por: Chen, Junying, et al.
Publicado: (2025)
Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey
por: Chen, Liang, et al.
Publicado: (2024)
por: Chen, Liang, et al.
Publicado: (2024)
Towards Controllable Speech Synthesis in the Era of Large Language Models: A Systematic Survey
por: Xie, Tianxin, et al.
Publicado: (2024)
por: Xie, Tianxin, et al.
Publicado: (2024)
LLaSO: A Foundational Framework for Reproducible Research in Large Language and Speech Model
por: Sun, Yirong, et al.
Publicado: (2025)
por: Sun, Yirong, et al.
Publicado: (2025)
A Multimodal Memes Classification: A Survey and Open Research Issues
por: Afridi, Tariq Habib, et al.
Publicado: (2020)
por: Afridi, Tariq Habib, et al.
Publicado: (2020)
Benchmarking Large Multimodal Models against Common Corruptions
por: Zhang, Jiawei, et al.
Publicado: (2024)
por: Zhang, Jiawei, et al.
Publicado: (2024)
MuChoMusic: Evaluating Music Understanding in Multimodal Audio-Language Models
por: Weck, Benno, et al.
Publicado: (2024)
por: Weck, Benno, et al.
Publicado: (2024)
OceanPile: A Large-Scale Multimodal Ocean Corpus for Foundation Models
por: Xue, Yida, et al.
Publicado: (2026)
por: Xue, Yida, et al.
Publicado: (2026)
Generative AI for Character Animation: A Comprehensive Survey of Techniques, Applications, and Future Directions
por: Abootorabi, Mohammad Mahdi, et al.
Publicado: (2025)
por: Abootorabi, Mohammad Mahdi, et al.
Publicado: (2025)
ModalImmune: Immunity Driven Unlearning via Self Destructive Training
por: Fu, Rong, et al.
Publicado: (2026)
por: Fu, Rong, et al.
Publicado: (2026)
OmniEvalKit: A Modular, Lightweight Toolbox for Evaluating Large Language Model and its Omni-Extensions
por: Zhang, Yi-Kai, et al.
Publicado: (2024)
por: Zhang, Yi-Kai, et al.
Publicado: (2024)
Multimodal Long Video Modeling Based on Temporal Dynamic Context
por: Hao, Haoran, et al.
Publicado: (2025)
por: Hao, Haoran, et al.
Publicado: (2025)
K-pop Lyric Translation: Dataset, Analysis, and Neural-Modelling
por: Kim, Haven, et al.
Publicado: (2023)
por: Kim, Haven, et al.
Publicado: (2023)
MUDI: A Multimodal Biomedical Dataset for Understanding Pharmacodynamic Drug-Drug Interactions
por: Ngo, Tung-Lam, et al.
Publicado: (2025)
por: Ngo, Tung-Lam, et al.
Publicado: (2025)
Decoding the Hook: A Multimodal LLM Framework for Analyzing the Hooking Period of Video Ads
por: Zhang, Kunpeng, et al.
Publicado: (2026)
por: Zhang, Kunpeng, et al.
Publicado: (2026)
WavChat: A Survey of Spoken Dialogue Models
por: Ji, Shengpeng, et al.
Publicado: (2024)
por: Ji, Shengpeng, et al.
Publicado: (2024)
mPLUG-PaperOwl: Scientific Diagram Analysis with the Multimodal Large Language Model
por: Hu, Anwen, et al.
Publicado: (2023)
por: Hu, Anwen, et al.
Publicado: (2023)
'No' Matters: Out-of-Distribution Detection in Multimodality Long Dialogue
por: Gao, Rena, et al.
Publicado: (2024)
por: Gao, Rena, et al.
Publicado: (2024)
Multimodal Multi-loss Fusion Network for Sentiment Analysis
por: Wu, Zehui, et al.
Publicado: (2023)
por: Wu, Zehui, et al.
Publicado: (2023)
SILMM: Self-Improving Large Multimodal Models for Compositional Text-to-Image Generation
por: Qu, Leigang, et al.
Publicado: (2024)
por: Qu, Leigang, et al.
Publicado: (2024)
TIGeR: Unifying Text-to-Image Generation and Retrieval with Large Multimodal Models
por: Qu, Leigang, et al.
Publicado: (2024)
por: Qu, Leigang, et al.
Publicado: (2024)
Language Models as Black-Box Optimizers for Vision-Language Models
por: Liu, Shihong, et al.
Publicado: (2023)
por: Liu, Shihong, et al.
Publicado: (2023)
Ejemplares similares
-
Large Language Models for Computer-Aided Design: A Survey
por: Zhang, Licheng, et al.
Publicado: (2025) -
Self-Comparison for Dataset-Level Membership Inference in Large (Vision-)Language Models
por: Ren, Jie, et al.
Publicado: (2024) -
ChemDFM-X: Towards Large Multimodal Model for Chemistry
por: Zhao, Zihan, et al.
Publicado: (2024) -
Doctor Sun: A Bilingual Multimodal Large Language Model for Biomedical AI
por: Xue, Dong, et al.
Publicado: (2025) -
Accelerating Multimodal Large Language Models via Dynamic Visual-Token Exit and the Empirical Findings
por: Wu, Qiong, et al.
Publicado: (2024)