Balancing Multimodal Training Through Game-Theoretic Regularization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kontras, Konstantinos, Strypsteen, Thomas, Chatzichristos, Christos, Liang, Paul Pu, Blaschko, Matthew, De Vos, Maarten |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Improving Multimodal Learning with Multi-Loss Gradient Modulation
par: Kontras, Konstantinos, et autres
Publié: (2024)
par: Kontras, Konstantinos, et autres
Publié: (2024)
Computational Thinking through Design Patterns in Video Games
par: Barbero, Giulio, et autres
Publié: (2024)
par: Barbero, Giulio, et autres
Publié: (2024)
Vista3D: Unravel the 3D Darkside of a Single Image
par: Shen, Qiuhong, et autres
Publié: (2024)
par: Shen, Qiuhong, et autres
Publié: (2024)
MultiMed: Massively Multimodal and Multitask Medical Understanding
par: Mo, Shentong, et autres
Publié: (2024)
par: Mo, Shentong, et autres
Publié: (2024)
Latent Reconstruction from Generated Data for Multimodal Misinformation Detection
par: Papadopoulos, Stefanos-Iordanis, et autres
Publié: (2025)
par: Papadopoulos, Stefanos-Iordanis, et autres
Publié: (2025)
RED-DOT: Multimodal Fact-checking via Relevant Evidence Detection
par: Papadopoulos, Stefanos-Iordanis, et autres
Publié: (2023)
par: Papadopoulos, Stefanos-Iordanis, et autres
Publié: (2023)
Across-Game Engagement Modelling via Few-Shot Learning
par: Pinitas, Kosmas, et autres
Publié: (2024)
par: Pinitas, Kosmas, et autres
Publié: (2024)
Foundations of Multisensory Artificial Intelligence
par: Liang, Paul Pu
Publié: (2024)
par: Liang, Paul Pu
Publié: (2024)
Towards Training-free Multimodal Hate Localisation with Large Language Models
par: Sun, Yueming, et autres
Publié: (2026)
par: Sun, Yueming, et autres
Publié: (2026)
Diagnosing and Re-learning for Balanced Multimodal Learning
par: Wei, Yake, et autres
Publié: (2024)
par: Wei, Yake, et autres
Publié: (2024)
MSRS: Training Multimodal Speech Recognition Models from Scratch with Sparse Mask Optimization
par: Fernandez-Lopez, Adriana, et autres
Publié: (2024)
par: Fernandez-Lopez, Adriana, et autres
Publié: (2024)
Regular Games with Imperfect Information Are Not That Regular
par: Doyen, Laurent, et autres
Publié: (2024)
par: Doyen, Laurent, et autres
Publié: (2024)
Seeing Through Deception: Uncovering Misleading Creator Intent in Multimodal News with Vision-Language Models
par: Wu, Jiaying, et autres
Publié: (2025)
par: Wu, Jiaying, et autres
Publié: (2025)
InfiMM-WebMath-40B: Advancing Multimodal Pre-Training for Enhanced Mathematical Reasoning
par: Han, Xiaotian, et autres
Publié: (2024)
par: Han, Xiaotian, et autres
Publié: (2024)
The More, the Merrier: Contrastive Fusion for Higher-Order Multimodal Alignment
par: Koutoupis, Stefanos, et autres
Publié: (2025)
par: Koutoupis, Stefanos, et autres
Publié: (2025)
Pistachio: Towards Synthetic, Balanced, and Long-Form Video Anomaly Benchmarks
par: Li, Jie, et autres
Publié: (2025)
par: Li, Jie, et autres
Publié: (2025)
Dynamic Self-adaptive Multiscale Distillation from Pre-trained Multimodal Large Model for Efficient Cross-modal Representation Learning
par: Liang, Zhengyang, et autres
Publié: (2024)
par: Liang, Zhengyang, et autres
Publié: (2024)
LMM-Regularized CLIP Embeddings for Image Classification
par: Tzelepi, Maria, et autres
Publié: (2024)
par: Tzelepi, Maria, et autres
Publié: (2024)
M-MRE: Extending the Mutual Reinforcement Effect to Multimodal Information Extraction
par: Gan, Chengguang, et autres
Publié: (2025)
par: Gan, Chengguang, et autres
Publié: (2025)
See or Guess: Counterfactually Regularized Image Captioning
par: Cao, Qian, et autres
Publié: (2024)
par: Cao, Qian, et autres
Publié: (2024)
Anchoring Emotions in Text: Robust Multimodal Fusion for Mimicry Intensity Estimation
par: Zhu, Lingsi, et autres
Publié: (2026)
par: Zhu, Lingsi, et autres
Publié: (2026)
On-the-fly Modulation for Balanced Multimodal Learning
par: Wei, Yake, et autres
Publié: (2024)
par: Wei, Yake, et autres
Publié: (2024)
Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models
par: Xu, Yifang, et autres
Publié: (2025)
par: Xu, Yifang, et autres
Publié: (2025)
Contrastive Regularization over LoRA for Multimodal Biomedical Image Incremental Learning
par: Zhang, Haojie, et autres
Publié: (2025)
par: Zhang, Haojie, et autres
Publié: (2025)
DRFormer: A Dual-Regularized Bidirectional Transformer for Person Re-identification
par: Shu, Ying, et autres
Publié: (2026)
par: Shu, Ying, et autres
Publié: (2026)
Similarity over Factuality: Are we making progress on multimodal out-of-context misinformation detection?
par: Papadopoulos, Stefanos-Iordanis, et autres
Publié: (2024)
par: Papadopoulos, Stefanos-Iordanis, et autres
Publié: (2024)
OmniScript: Towards Audio-Visual Script Generation for Long-Form Cinematic Video
par: Pu, Junfu, et autres
Publié: (2026)
par: Pu, Junfu, et autres
Publié: (2026)
MorphText: Deep Morphology Regularized Arbitrary-shape Scene Text Detection
par: Xu, Chengpei, et autres
Publié: (2024)
par: Xu, Chengpei, et autres
Publié: (2024)
Detached and Interactive Multimodal Learning
par: Fan, Yunfeng, et autres
Publié: (2024)
par: Fan, Yunfeng, et autres
Publié: (2024)
Study of Subjective and Objective Quality Assessment of Mobile Cloud Gaming Videos
par: Saha, Avinab, et autres
Publié: (2023)
par: Saha, Avinab, et autres
Publié: (2023)
OralGPT-Omni: A Versatile Dental Multimodal Large Language Model
par: Hao, Jing, et autres
Publié: (2025)
par: Hao, Jing, et autres
Publié: (2025)
A Game-Theoretic Framework for Distributed Load Balancing: Static and Dynamic Game Models
par: Fardno, Fatemeh, et autres
Publié: (2025)
par: Fardno, Fatemeh, et autres
Publié: (2025)
DT-UFC: Universal Large Model Feature Coding via Peaky-to-Balanced Distribution Transformation
par: Gao, Changsheng, et autres
Publié: (2025)
par: Gao, Changsheng, et autres
Publié: (2025)
PRINTER:Deformation-Aware Adversarial Learning for Virtual IHC Staining with In Situ Fidelity
par: Yuan, Yizhe, et autres
Publié: (2025)
par: Yuan, Yizhe, et autres
Publié: (2025)
Deep Reversible Consistency Learning for Cross-modal Retrieval
par: Pu, Ruitao, et autres
Publié: (2025)
par: Pu, Ruitao, et autres
Publié: (2025)
PRoGS: Progressive Rendering of Gaussian Splats
par: Zoomers, Brent, et autres
Publié: (2024)
par: Zoomers, Brent, et autres
Publié: (2024)
Learning Video Context as Interleaved Multimodal Sequences
par: Lin, Kevin Qinghong, et autres
Publié: (2024)
par: Lin, Kevin Qinghong, et autres
Publié: (2024)
ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
par: Zhang, Zhenxing, et autres
Publié: (2024)
par: Zhang, Zhenxing, et autres
Publié: (2024)
Grounded Chain-of-Thought for Multimodal Large Language Models
par: Wu, Qiong, et autres
Publié: (2025)
par: Wu, Qiong, et autres
Publié: (2025)
A Multimodal Transformer for Live Streaming Highlight Prediction
par: Deng, Jiaxin, et autres
Publié: (2024)
par: Deng, Jiaxin, et autres
Publié: (2024)
Documents similaires
-
Improving Multimodal Learning with Multi-Loss Gradient Modulation
par: Kontras, Konstantinos, et autres
Publié: (2024) -
Computational Thinking through Design Patterns in Video Games
par: Barbero, Giulio, et autres
Publié: (2024) -
Vista3D: Unravel the 3D Darkside of a Single Image
par: Shen, Qiuhong, et autres
Publié: (2024) -
MultiMed: Massively Multimodal and Multitask Medical Understanding
par: Mo, Shentong, et autres
Publié: (2024) -
Latent Reconstruction from Generated Data for Multimodal Misinformation Detection
par: Papadopoulos, Stefanos-Iordanis, et autres
Publié: (2025)