Efficient Multimodal Learning from Data-centric Perspective
Fuente:
arXiv
Salvato in:
| Autori principali: | He, Muyang, Liu, Yexin, Wu, Boya, Yuan, Jianhao, Wang, Yueze, Huang, Tiejun, Zhao, Bo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Large-scale Dataset Pruning with Dynamic Uncertainty
di: He, Muyang, et al.
Pubblicazione: (2023)
di: He, Muyang, et al.
Pubblicazione: (2023)
Unveiling the Ignorance of MLLMs: Seeing Clearly, Answering Incorrectly
di: Liu, Yexin, et al.
Pubblicazione: (2024)
di: Liu, Yexin, et al.
Pubblicazione: (2024)
Efficient Multimodal Large Language Models: A Survey
di: Jin, Yizhang, et al.
Pubblicazione: (2024)
di: Jin, Yizhang, et al.
Pubblicazione: (2024)
SynArtifact: Classifying and Alleviating Artifacts in Synthetic Images via Vision-Language Model
di: Cao, Bin, et al.
Pubblicazione: (2024)
di: Cao, Bin, et al.
Pubblicazione: (2024)
Emu: Generative Pretraining in Multimodality
di: Sun, Quan, et al.
Pubblicazione: (2023)
di: Sun, Quan, et al.
Pubblicazione: (2023)
Brain-Inspired Multimodal Spiking Neural Network for Image-Text Retrieval
di: Zong, Xintao, et al.
Pubblicazione: (2026)
di: Zong, Xintao, et al.
Pubblicazione: (2026)
Generative Multimodal Models are In-Context Learners
di: Sun, Quan, et al.
Pubblicazione: (2023)
di: Sun, Quan, et al.
Pubblicazione: (2023)
A Survey of Multimodal Large Language Model from A Data-centric Perspective
di: Bai, Tianyi, et al.
Pubblicazione: (2024)
di: Bai, Tianyi, et al.
Pubblicazione: (2024)
MegaPairs: Massive Data Synthesis For Universal Multimodal Retrieval
di: Zhou, Junjie, et al.
Pubblicazione: (2024)
di: Zhou, Junjie, et al.
Pubblicazione: (2024)
OmniGen2: Towards Instruction-Aligned Multimodal Generation
di: Wu, Chenyuan, et al.
Pubblicazione: (2025)
di: Wu, Chenyuan, et al.
Pubblicazione: (2025)
AlignVid: Training-Free Attention Scaling for Semantic Fidelity in Text-Guided Image-to-Video Generation
di: Liu, Yexin, et al.
Pubblicazione: (2025)
di: Liu, Yexin, et al.
Pubblicazione: (2025)
Towards Low-latency Event-based Visual Recognition with Hybrid Step-wise Distillation Spiking Neural Networks
di: Zhong, Xian, et al.
Pubblicazione: (2024)
di: Zhong, Xian, et al.
Pubblicazione: (2024)
Towards High-performance Spiking Transformers from ANN to SNN Conversion
di: Huang, Zihan, et al.
Pubblicazione: (2025)
di: Huang, Zihan, et al.
Pubblicazione: (2025)
Rethinking Multimodal Learning from the Perspective of Mitigating Classification Ability Disproportion
di: Jiang, QingYuan, et al.
Pubblicazione: (2025)
di: Jiang, QingYuan, et al.
Pubblicazione: (2025)
SegVol: Universal and Interactive Volumetric Medical Image Segmentation
di: Du, Yuxin, et al.
Pubblicazione: (2023)
di: Du, Yuxin, et al.
Pubblicazione: (2023)
Caption Anything in Video: Fine-grained Object-centric Captioning via Spatiotemporal Multimodal Prompting
di: Tang, Yunlong, et al.
Pubblicazione: (2025)
di: Tang, Yunlong, et al.
Pubblicazione: (2025)
OmniGen: Unified Image Generation
di: Xiao, Shitao, et al.
Pubblicazione: (2024)
di: Xiao, Shitao, et al.
Pubblicazione: (2024)
Emu3: Next-Token Prediction is All You Need
di: Wang, Xinlong, et al.
Pubblicazione: (2024)
di: Wang, Xinlong, et al.
Pubblicazione: (2024)
Emu3.5: Native Multimodal Models are World Learners
di: Cui, Yufeng, et al.
Pubblicazione: (2025)
di: Cui, Yufeng, et al.
Pubblicazione: (2025)
DesignProbe: A Graphic Design Benchmark for Multimodal Large Language Models
di: Lin, Jieru, et al.
Pubblicazione: (2024)
di: Lin, Jieru, et al.
Pubblicazione: (2024)
SpikeCV: Open a Continuous Computer Vision Era
di: Zheng, Yajing, et al.
Pubblicazione: (2023)
di: Zheng, Yajing, et al.
Pubblicazione: (2023)
OpenSubject: Leveraging Video-Derived Identity and Diversity Priors for Subject-driven Image Generation and Manipulation
di: Liu, Yexin, et al.
Pubblicazione: (2025)
di: Liu, Yexin, et al.
Pubblicazione: (2025)
H-MoRe: Learning Human-centric Motion Representation for Action Analysis
di: Huang, Zhanbo, et al.
Pubblicazione: (2025)
di: Huang, Zhanbo, et al.
Pubblicazione: (2025)
Enhanced Continual Learning of Vision-Language Models with Model Fusion
di: Gao, Haoyuan, et al.
Pubblicazione: (2025)
di: Gao, Haoyuan, et al.
Pubblicazione: (2025)
Rethinking Image-to-Video Adaptation: An Object-centric Perspective
di: Qian, Rui, et al.
Pubblicazione: (2024)
di: Qian, Rui, et al.
Pubblicazione: (2024)
Think 360°: Evaluating the Width-centric Reasoning Capability of MLLMs Beyond Depth
di: Chen, Mingrui, et al.
Pubblicazione: (2026)
di: Chen, Mingrui, et al.
Pubblicazione: (2026)
ProVision: Programmatically Scaling Vision-centric Instruction Data for Multimodal Language Models
di: Zhang, Jieyu, et al.
Pubblicazione: (2024)
di: Zhang, Jieyu, et al.
Pubblicazione: (2024)
STORM: Token-Efficient Long Video Understanding for Multimodal LLMs
di: Jiang, Jindong, et al.
Pubblicazione: (2025)
di: Jiang, Jindong, et al.
Pubblicazione: (2025)
Learning to Robustly Reconstruct Low-light Dynamic Scenes from Spike Streams
di: Hu, Liwen, et al.
Pubblicazione: (2024)
di: Hu, Liwen, et al.
Pubblicazione: (2024)
StyleInject: Parameter Efficient Tuning of Text-to-Image Diffusion Models
di: Zhou, Mohan, et al.
Pubblicazione: (2024)
di: Zhou, Mohan, et al.
Pubblicazione: (2024)
Source-free Semantic Regularization Learning for Semi-supervised Domain Adaptation
di: Huang, Xinyang, et al.
Pubblicazione: (2025)
di: Huang, Xinyang, et al.
Pubblicazione: (2025)
Not Just Pretty Pictures: Toward Interventional Data Augmentation Using Text-to-Image Generators
di: Yuan, Jianhao, et al.
Pubblicazione: (2022)
di: Yuan, Jianhao, et al.
Pubblicazione: (2022)
MLVU: Benchmarking Multi-task Long Video Understanding
di: Zhou, Junjie, et al.
Pubblicazione: (2024)
di: Zhou, Junjie, et al.
Pubblicazione: (2024)
Exploring Efficient Asymmetric Blind-Spots for Self-Supervised Denoising in Real-World Scenarios
di: Chen, Shiyan, et al.
Pubblicazione: (2023)
di: Chen, Shiyan, et al.
Pubblicazione: (2023)
Universal Prompt Optimizer for Safe Text-to-Image Generation
di: Wu, Zongyu, et al.
Pubblicazione: (2024)
di: Wu, Zongyu, et al.
Pubblicazione: (2024)
CGMatch: A Different Perspective of Semi-supervised Learning
di: Cheng, Bo, et al.
Pubblicazione: (2025)
di: Cheng, Bo, et al.
Pubblicazione: (2025)
Efficient Multimodal Dataset Distillation via Generative Models
di: Zhao, Zhenghao, et al.
Pubblicazione: (2025)
di: Zhao, Zhenghao, et al.
Pubblicazione: (2025)
MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces
di: E, Shaojun, et al.
Pubblicazione: (2025)
di: E, Shaojun, et al.
Pubblicazione: (2025)
GoodSAM++: Bridging Domain and Capacity Gaps via Segment Anything Model for Panoramic Semantic Segmentation
di: Zhang, Weiming, et al.
Pubblicazione: (2024)
di: Zhang, Weiming, et al.
Pubblicazione: (2024)
GoodSAM: Bridging Domain and Capacity Gaps via Segment Anything Model for Distortion-aware Panoramic Semantic Segmentation
di: Zhang, Weiming, et al.
Pubblicazione: (2024)
di: Zhang, Weiming, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Large-scale Dataset Pruning with Dynamic Uncertainty
di: He, Muyang, et al.
Pubblicazione: (2023) -
Unveiling the Ignorance of MLLMs: Seeing Clearly, Answering Incorrectly
di: Liu, Yexin, et al.
Pubblicazione: (2024) -
Efficient Multimodal Large Language Models: A Survey
di: Jin, Yizhang, et al.
Pubblicazione: (2024) -
SynArtifact: Classifying and Alleviating Artifacts in Synthetic Images via Vision-Language Model
di: Cao, Bin, et al.
Pubblicazione: (2024) -
Emu: Generative Pretraining in Multimodality
di: Sun, Quan, et al.
Pubblicazione: (2023)