Towards Modality Generalization: A Benchmark and Prospective Analysis
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Xiaohao, Xia, Xiaobo, Huang, Zhuo, Ng, See-Kiong, Chua, Tat-Seng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Principled Multimodal Representation Learning
di: Liu, Xiaohao, et al.
Pubblicazione: (2025)
di: Liu, Xiaohao, et al.
Pubblicazione: (2025)
Calibrated Multimodal Representation Learning with Missing Modalities
di: Liu, Xiaohao, et al.
Pubblicazione: (2025)
di: Liu, Xiaohao, et al.
Pubblicazione: (2025)
Continual Multimodal Contrastive Learning
di: Liu, Xiaohao, et al.
Pubblicazione: (2025)
di: Liu, Xiaohao, et al.
Pubblicazione: (2025)
Image Can Bring Your Memory Back: A Novel Multi-Modal Guided Attack against Image Generation Model Unlearning
di: Liu, Renyang, et al.
Pubblicazione: (2025)
di: Liu, Renyang, et al.
Pubblicazione: (2025)
FreeAct: Freeing Activations for LLM Quantization
di: Liu, Xiaohao, et al.
Pubblicazione: (2026)
di: Liu, Xiaohao, et al.
Pubblicazione: (2026)
Omnimodal Dataset Distillation via High-order Proxy Alignment
di: Gao, Yuxuan, et al.
Pubblicazione: (2026)
di: Gao, Yuxuan, et al.
Pubblicazione: (2026)
Extending Visual Dynamics for Video-to-Music Generation
di: Liu, Xiaohao, et al.
Pubblicazione: (2025)
di: Liu, Xiaohao, et al.
Pubblicazione: (2025)
Data-Free Federated Class Incremental Learning with Diffusion-Based Generative Memory
di: Wang, Naibo, et al.
Pubblicazione: (2024)
di: Wang, Naibo, et al.
Pubblicazione: (2024)
Active Zero: Self-Evolving Vision-Language Models through Active Environment Exploration
di: He, Jinghan, et al.
Pubblicazione: (2026)
di: He, Jinghan, et al.
Pubblicazione: (2026)
TTOM: Test-Time Optimization and Memorization for Compositional Video Generation
di: Qu, Leigang, et al.
Pubblicazione: (2025)
di: Qu, Leigang, et al.
Pubblicazione: (2025)
One-Shot Sequential Federated Learning for Non-IID Data by Enhancing Local Model Diversity
di: Wang, Naibo, et al.
Pubblicazione: (2024)
di: Wang, Naibo, et al.
Pubblicazione: (2024)
Lingua-SafetyBench: A Benchmark for Safety Evaluation of Multilingual Vision-Language Models
di: Shi, Enyi, et al.
Pubblicazione: (2026)
di: Shi, Enyi, et al.
Pubblicazione: (2026)
SafeRedir: Prompt Embedding Redirection for Robust Unlearning in Image Generation Models
di: Liu, Renyang, et al.
Pubblicazione: (2026)
di: Liu, Renyang, et al.
Pubblicazione: (2026)
SILMM: Self-Improving Large Multimodal Models for Compositional Text-to-Image Generation
di: Qu, Leigang, et al.
Pubblicazione: (2024)
di: Qu, Leigang, et al.
Pubblicazione: (2024)
Cocktail: Mixing Multi-Modality Controls for Text-Conditional Image Generation
di: Hu, Minghui, et al.
Pubblicazione: (2023)
di: Hu, Minghui, et al.
Pubblicazione: (2023)
Universal Scene Graph Generation
di: Wu, Shengqiong, et al.
Pubblicazione: (2025)
di: Wu, Shengqiong, et al.
Pubblicazione: (2025)
Towards Unified Benchmark and Models for Multi-Modal Perceptual Metrics
di: Ghazanfari, Sara, et al.
Pubblicazione: (2024)
di: Ghazanfari, Sara, et al.
Pubblicazione: (2024)
ITS3D: Inference-Time Scaling for Text-Guided 3D Diffusion Models
di: Zhou, Zhenglin, et al.
Pubblicazione: (2025)
di: Zhou, Zhenglin, et al.
Pubblicazione: (2025)
TIGeR: Unifying Text-to-Image Generation and Retrieval with Large Multimodal Models
di: Qu, Leigang, et al.
Pubblicazione: (2024)
di: Qu, Leigang, et al.
Pubblicazione: (2024)
STEP: Enhancing Video-LLMs' Compositional Reasoning by Spatio-Temporal Graph-guided Self-Training
di: Qiu, Haiyi, et al.
Pubblicazione: (2024)
di: Qiu, Haiyi, et al.
Pubblicazione: (2024)
Don't Just Say "I don't know"! Self-aligning Large Language Models for Responding to Unknown Questions with Explanations
di: Deng, Yang, et al.
Pubblicazione: (2024)
di: Deng, Yang, et al.
Pubblicazione: (2024)
Towards Natural Language-Guided Drones: GeoText-1652 Benchmark with Spatial Relation Matching
di: Chu, Meng, et al.
Pubblicazione: (2023)
di: Chu, Meng, et al.
Pubblicazione: (2023)
Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval
di: Fang, Xiang, et al.
Pubblicazione: (2026)
di: Fang, Xiang, et al.
Pubblicazione: (2026)
Compose Your Aesthetics: Empowering Text-to-Image Models with the Principles of Art
di: Jin, Zhe, et al.
Pubblicazione: (2025)
di: Jin, Zhe, et al.
Pubblicazione: (2025)
AUHead: Realistic Emotional Talking Head Generation via Action Units Control
di: Lyu, Jiayi, et al.
Pubblicazione: (2026)
di: Lyu, Jiayi, et al.
Pubblicazione: (2026)
AnchorFlow: Training-Free 3D Editing via Latent Anchor-Aligned Flows
di: Zhou, Zhenglin, et al.
Pubblicazione: (2025)
di: Zhou, Zhenglin, et al.
Pubblicazione: (2025)
SEIS: Subspace-based Equivariance and Invariance Scores for Neural Representations
di: Lin, Huahua, et al.
Pubblicazione: (2026)
di: Lin, Huahua, et al.
Pubblicazione: (2026)
FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs
di: Chen, Qian, et al.
Pubblicazione: (2026)
di: Chen, Qian, et al.
Pubblicazione: (2026)
MMP: Towards Robust Multi-Modal Learning with Masked Modality Projection
di: Nezakati, Niki, et al.
Pubblicazione: (2024)
di: Nezakati, Niki, et al.
Pubblicazione: (2024)
DPL: Decoupled Prototype Learning for Enhancing Robustness of Vision-Language Transformers to Missing Modalities
di: Lu, Jueqing, et al.
Pubblicazione: (2025)
di: Lu, Jueqing, et al.
Pubblicazione: (2025)
UtilGen: Utility-Centric Generative Data Augmentation with Dual-Level Task Adaptation
di: Guo, Jiyu, et al.
Pubblicazione: (2025)
di: Guo, Jiyu, et al.
Pubblicazione: (2025)
Feature-based Graph Attention Networks Improve Online Continual Learning
di: Sim, Adjovi, et al.
Pubblicazione: (2025)
di: Sim, Adjovi, et al.
Pubblicazione: (2025)
A Generalization Theory of Cross-Modality Distillation with Contrastive Learning
di: Lin, Hangyu, et al.
Pubblicazione: (2024)
di: Lin, Hangyu, et al.
Pubblicazione: (2024)
Disentangling Masked Autoencoders for Unsupervised Domain Generalization
di: Zhang, An, et al.
Pubblicazione: (2024)
di: Zhang, An, et al.
Pubblicazione: (2024)
Modality-Balanced Collaborative Distillation for Multi-Modal Domain Generalization
di: Wang, Xiaohan, et al.
Pubblicazione: (2025)
di: Wang, Xiaohan, et al.
Pubblicazione: (2025)
VisionTS++: Cross-Modal Time Series Foundation Model with Continual Pre-trained Vision Backbones
di: Shen, Lefei, et al.
Pubblicazione: (2025)
di: Shen, Lefei, et al.
Pubblicazione: (2025)
Hierarchical Multi-Graphs Learning for Robust Group Re-Identification
di: Liu, Ruiqi, et al.
Pubblicazione: (2024)
di: Liu, Ruiqi, et al.
Pubblicazione: (2024)
LogiCode: an LLM-Driven Framework for Logical Anomaly Detection
di: Zhang, Yiheng, et al.
Pubblicazione: (2024)
di: Zhang, Yiheng, et al.
Pubblicazione: (2024)
Building Age Estimation: A New Multi-Modal Benchmark Dataset and Community Challenge
di: Dionelis, Nikolaos, et al.
Pubblicazione: (2025)
di: Dionelis, Nikolaos, et al.
Pubblicazione: (2025)
Enhancing Cross-Modal Fine-Tuning with Gradually Intermediate Modality Generation
di: Cai, Lincan, et al.
Pubblicazione: (2024)
di: Cai, Lincan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Principled Multimodal Representation Learning
di: Liu, Xiaohao, et al.
Pubblicazione: (2025) -
Calibrated Multimodal Representation Learning with Missing Modalities
di: Liu, Xiaohao, et al.
Pubblicazione: (2025) -
Continual Multimodal Contrastive Learning
di: Liu, Xiaohao, et al.
Pubblicazione: (2025) -
Image Can Bring Your Memory Back: A Novel Multi-Modal Guided Attack against Image Generation Model Unlearning
di: Liu, Renyang, et al.
Pubblicazione: (2025) -
FreeAct: Freeing Activations for LLM Quantization
di: Liu, Xiaohao, et al.
Pubblicazione: (2026)