Salvato in:
| Autori principali: | Pellegrain, Victor, Tami, Myriam, Batteux, Michel, Hudelot, Céline |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2021
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2110.08021 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Training Data Efficiency in Multimodal Process Reward Models
di: Li, Jinyuan, et al.
Pubblicazione: (2026)
di: Li, Jinyuan, et al.
Pubblicazione: (2026)
'No' Matters: Out-of-Distribution Detection in Multimodality Long Dialogue
di: Gao, Rena, et al.
Pubblicazione: (2024)
di: Gao, Rena, et al.
Pubblicazione: (2024)
ChemDFM-X: Towards Large Multimodal Model for Chemistry
di: Zhao, Zihan, et al.
Pubblicazione: (2024)
di: Zhao, Zihan, et al.
Pubblicazione: (2024)
MemeCLIP: Leveraging CLIP Representations for Multimodal Meme Classification
di: Shah, Siddhant Bikram, et al.
Pubblicazione: (2024)
di: Shah, Siddhant Bikram, et al.
Pubblicazione: (2024)
Multimodal Large Language Models for Medicine: A Comprehensive Survey
di: Ye, Jiarui, et al.
Pubblicazione: (2025)
di: Ye, Jiarui, et al.
Pubblicazione: (2025)
Dental-TriageBench: Benchmarking Multimodal Reasoning for Hierarchical Dental Triage
di: He, Ziyi, et al.
Pubblicazione: (2026)
di: He, Ziyi, et al.
Pubblicazione: (2026)
KMMMU: Evaluation of Massive Multi-discipline Multimodal Understanding in Korean Language and Context
di: Lee, Nahyun, et al.
Pubblicazione: (2026)
di: Lee, Nahyun, et al.
Pubblicazione: (2026)
DLF: Disentangled-Language-Focused Multimodal Sentiment Analysis
di: Wang, Pan, et al.
Pubblicazione: (2024)
di: Wang, Pan, et al.
Pubblicazione: (2024)
Multimodal Multi-loss Fusion Network for Sentiment Analysis
di: Wu, Zehui, et al.
Pubblicazione: (2023)
di: Wu, Zehui, et al.
Pubblicazione: (2023)
Multimodal Long Video Modeling Based on Temporal Dynamic Context
di: Hao, Haoran, et al.
Pubblicazione: (2025)
di: Hao, Haoran, et al.
Pubblicazione: (2025)
MUDI: A Multimodal Biomedical Dataset for Understanding Pharmacodynamic Drug-Drug Interactions
di: Ngo, Tung-Lam, et al.
Pubblicazione: (2025)
di: Ngo, Tung-Lam, et al.
Pubblicazione: (2025)
Doctor Sun: A Bilingual Multimodal Large Language Model for Biomedical AI
di: Xue, Dong, et al.
Pubblicazione: (2025)
di: Xue, Dong, et al.
Pubblicazione: (2025)
Decoding the Hook: A Multimodal LLM Framework for Analyzing the Hooking Period of Video Ads
di: Zhang, Kunpeng, et al.
Pubblicazione: (2026)
di: Zhang, Kunpeng, et al.
Pubblicazione: (2026)
MuPHI: Learning Implicit Multimodal Harm Reasoning via Semantically Grounded Reward Optimization
di: Saha, Anisha, et al.
Pubblicazione: (2026)
di: Saha, Anisha, et al.
Pubblicazione: (2026)
Sample then Identify: A General Framework for Risk Control and Assessment in Multimodal Large Language Models
di: Wang, Qingni, et al.
Pubblicazione: (2024)
di: Wang, Qingni, et al.
Pubblicazione: (2024)
Multi-level Mixture of Experts for Multimodal Entity Linking
di: Hu, Zhiwei, et al.
Pubblicazione: (2025)
di: Hu, Zhiwei, et al.
Pubblicazione: (2025)
Continual Multimodal Knowledge Graph Construction
di: Chen, Xiang, et al.
Pubblicazione: (2023)
di: Chen, Xiang, et al.
Pubblicazione: (2023)
Calibrating Multimodal Consensus for Emotion Recognition
di: Zhong, Guowei, et al.
Pubblicazione: (2025)
di: Zhong, Guowei, et al.
Pubblicazione: (2025)
LongVALE: Vision-Audio-Language-Event Benchmark Towards Time-Aware Omni-Modal Perception of Long Videos
di: Geng, Tiantian, et al.
Pubblicazione: (2024)
di: Geng, Tiantian, et al.
Pubblicazione: (2024)
Emotion Collider: Dual Hyperbolic Mirror Manifolds for Sentiment Recovery via Anti Emotion Reflection
di: Fu, Rong, et al.
Pubblicazione: (2026)
di: Fu, Rong, et al.
Pubblicazione: (2026)
K-pop Lyric Translation: Dataset, Analysis, and Neural-Modelling
di: Kim, Haven, et al.
Pubblicazione: (2023)
di: Kim, Haven, et al.
Pubblicazione: (2023)
Where Do We Go from Here? Multi-scale Allocentric Relational Inference from Natural Spatial Descriptions
di: Paz-Argaman, Tzuf, et al.
Pubblicazione: (2024)
di: Paz-Argaman, Tzuf, et al.
Pubblicazione: (2024)
Proactive Conversational Assistant for a Procedural Manual Task based on Audio and IMU
di: Mahfuz, Rehana, et al.
Pubblicazione: (2026)
di: Mahfuz, Rehana, et al.
Pubblicazione: (2026)
Self-Comparison for Dataset-Level Membership Inference in Large (Vision-)Language Models
di: Ren, Jie, et al.
Pubblicazione: (2024)
di: Ren, Jie, et al.
Pubblicazione: (2024)
Mixture of LoRA Experts
di: Wu, Xun, et al.
Pubblicazione: (2024)
di: Wu, Xun, et al.
Pubblicazione: (2024)
ModalImmune: Immunity Driven Unlearning via Self Destructive Training
di: Fu, Rong, et al.
Pubblicazione: (2026)
di: Fu, Rong, et al.
Pubblicazione: (2026)
Multi-Modal Discussion Transformer: Integrating Text, Images and Graph Transformers to Detect Hate Speech on Social Media
di: Hebert, Liam, et al.
Pubblicazione: (2023)
di: Hebert, Liam, et al.
Pubblicazione: (2023)
Towards Robust Multimodal Emotion Recognition under Missing Modalities and Distribution Shifts
di: Zhong, Guowei, et al.
Pubblicazione: (2025)
di: Zhong, Guowei, et al.
Pubblicazione: (2025)
MultiScript30k: Leveraging Multilingual Embeddings to Extend Cross Script Parallel Data
di: Driggers-Ellis, Christopher, et al.
Pubblicazione: (2025)
di: Driggers-Ellis, Christopher, et al.
Pubblicazione: (2025)
Accelerating Multimodal Large Language Models via Dynamic Visual-Token Exit and the Empirical Findings
di: Wu, Qiong, et al.
Pubblicazione: (2024)
di: Wu, Qiong, et al.
Pubblicazione: (2024)
StreamingT2V: Consistent, Dynamic, and Extendable Long Video Generation from Text
di: Henschel, Roberto, et al.
Pubblicazione: (2024)
di: Henschel, Roberto, et al.
Pubblicazione: (2024)
Video DataFlywheel: Resolving the Impossible Data Trinity in Video-Language Understanding
di: Wang, Xiao, et al.
Pubblicazione: (2024)
di: Wang, Xiao, et al.
Pubblicazione: (2024)
Holistic Evaluation of Multimodal LLMs on Spatial Intelligence
di: Cai, Zhongang, et al.
Pubblicazione: (2025)
di: Cai, Zhongang, et al.
Pubblicazione: (2025)
Automating Steering for Safe Multimodal Large Language Models
di: Wu, Lyucheng, et al.
Pubblicazione: (2025)
di: Wu, Lyucheng, et al.
Pubblicazione: (2025)
Unified Hallucination Detection for Multimodal Large Language Models
di: Chen, Xiang, et al.
Pubblicazione: (2024)
di: Chen, Xiang, et al.
Pubblicazione: (2024)
Large Language Models for Computer-Aided Design: A Survey
di: Zhang, Licheng, et al.
Pubblicazione: (2025)
di: Zhang, Licheng, et al.
Pubblicazione: (2025)
Bridging the Data Provenance Gap Across Text, Speech and Video
di: Longpre, Shayne, et al.
Pubblicazione: (2024)
di: Longpre, Shayne, et al.
Pubblicazione: (2024)
MuChoMusic: Evaluating Music Understanding in Multimodal Audio-Language Models
di: Weck, Benno, et al.
Pubblicazione: (2024)
di: Weck, Benno, et al.
Pubblicazione: (2024)
Let Multimodal Embedders Learn When to Augment Query via Adaptive Query Augmentation
di: Kim, Wongyu, et al.
Pubblicazione: (2025)
di: Kim, Wongyu, et al.
Pubblicazione: (2025)
NVLM: Open Frontier-Class Multimodal LLMs
di: Dai, Wenliang, et al.
Pubblicazione: (2024)
di: Dai, Wenliang, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Training Data Efficiency in Multimodal Process Reward Models
di: Li, Jinyuan, et al.
Pubblicazione: (2026) -
'No' Matters: Out-of-Distribution Detection in Multimodality Long Dialogue
di: Gao, Rena, et al.
Pubblicazione: (2024) -
ChemDFM-X: Towards Large Multimodal Model for Chemistry
di: Zhao, Zihan, et al.
Pubblicazione: (2024) -
MemeCLIP: Leveraging CLIP Representations for Multimodal Meme Classification
di: Shah, Siddhant Bikram, et al.
Pubblicazione: (2024) -
Multimodal Large Language Models for Medicine: A Comprehensive Survey
di: Ye, Jiarui, et al.
Pubblicazione: (2025)