Multimodal Dataset Distillation via Phased Teacher Models
Fuente:
arXiv
Saved in:
| Main Authors: | Guo, Shengbin, Zhao, Hang, Yang, Senqiao, Jiang, Chenyang, Cheng, Yuhang, Peng, Xiangru, Shao, Rui, Tian, Zhuotao |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Mitigating Object Hallucinations via Sentence-Level Early Intervention
by: Peng, Shangpin, et al.
Published: (2025)
by: Peng, Shangpin, et al.
Published: (2025)
Unified Language-driven Zero-shot Domain Adaptation
by: Yang, Senqiao, et al.
Published: (2024)
by: Yang, Senqiao, et al.
Published: (2024)
Consistency Beyond Contrast: Enhancing Open-Vocabulary Object Detection Robustness via Contextual Consistency Learning
by: Li, Bozhao, et al.
Published: (2026)
by: Li, Bozhao, et al.
Published: (2026)
LISA++: An Improved Baseline for Reasoning Segmentation with Large Language Model
by: Yang, Senqiao, et al.
Published: (2023)
by: Yang, Senqiao, et al.
Published: (2023)
Explore the Potential of CLIP for Training-Free Open Vocabulary Semantic Segmentation
by: Shao, Tong, et al.
Published: (2024)
by: Shao, Tong, et al.
Published: (2024)
Typicalness-Aware Learning for Failure Detection
by: Liu, Yijun, et al.
Published: (2024)
by: Liu, Yijun, et al.
Published: (2024)
Parameterizing Dataset Distillation via Gaussian Splatting
by: Jiang, Chenyang, et al.
Published: (2025)
by: Jiang, Chenyang, et al.
Published: (2025)
Efficient Multimodal Dataset Distillation via Generative Models
by: Zhao, Zhenghao, et al.
Published: (2025)
by: Zhao, Zhenghao, et al.
Published: (2025)
VisionZip: Longer is Better but Not Necessary in Vision Language Models
by: Yang, Senqiao, et al.
Published: (2024)
by: Yang, Senqiao, et al.
Published: (2024)
Rectifying Soft-Label Entangled Bias in Long-Tailed Dataset Distillation
by: Jiang, Chenyang, et al.
Published: (2025)
by: Jiang, Chenyang, et al.
Published: (2025)
MMT-ARD: Multimodal Multi-Teacher Adversarial Distillation for Robust Vision-Language Models
by: Li, Yuqi, et al.
Published: (2025)
by: Li, Yuqi, et al.
Published: (2025)
Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation
by: Ning, Zhenhua, et al.
Published: (2025)
by: Ning, Zhenhua, et al.
Published: (2025)
UniEditBench: A Unified and Cost-Effective Benchmark for Image and Video Editing via Distilled MLLMs
by: Jiang, Lifan, et al.
Published: (2026)
by: Jiang, Lifan, et al.
Published: (2026)
Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation
by: Xia, Jiaer, et al.
Published: (2025)
by: Xia, Jiaer, et al.
Published: (2025)
Plug-and-Play Fidelity Optimization for Diffusion Transformer Acceleration via Cumulative Error Minimization
by: Shao, Tong, et al.
Published: (2025)
by: Shao, Tong, et al.
Published: (2025)
Efficient Dataset Distillation via Minimax Diffusion
by: Gu, Jianyang, et al.
Published: (2023)
by: Gu, Jianyang, et al.
Published: (2023)
D$^4$M: Dataset Distillation via Disentangled Diffusion Model
by: Su, Duo, et al.
Published: (2024)
by: Su, Duo, et al.
Published: (2024)
Does Your Vision-Language Model Get Lost in the Long Video Sampling Dilemma?
by: Qu, Tianyuan, et al.
Published: (2025)
by: Qu, Tianyuan, et al.
Published: (2025)
SemanticFace: Semantic Facial Action Estimation via Semantic Distillation in Interpretable Space
by: Kang, Zejian, et al.
Published: (2026)
by: Kang, Zejian, et al.
Published: (2026)
OA-CNNs: Omni-Adaptive Sparse CNNs for 3D Semantic Segmentation
by: Peng, Bohao, et al.
Published: (2024)
by: Peng, Bohao, et al.
Published: (2024)
GroupContrast: Semantic-aware Self-supervised Representation Learning for 3D Understanding
by: Wang, Chengyao, et al.
Published: (2024)
by: Wang, Chengyao, et al.
Published: (2024)
Uni-DPO: A Unified Paradigm for Dynamic Preference Optimization of LLMs
by: Peng, Shangpin, et al.
Published: (2025)
by: Peng, Shangpin, et al.
Published: (2025)
X2I: Seamless Integration of Multimodal Understanding into Diffusion Transformer via Attention Distillation
by: Ma, Jian, et al.
Published: (2025)
by: Ma, Jian, et al.
Published: (2025)
UDD: Dataset Distillation via Mining Underutilized Regions
by: Wang, Shiguang, et al.
Published: (2024)
by: Wang, Shiguang, et al.
Published: (2024)
Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs
by: Lai, Xin, et al.
Published: (2024)
by: Lai, Xin, et al.
Published: (2024)
SOLAR: Self-supervised Joint Learning for Symmetric Multimodal Retrieval
by: Yang, Wenjie, et al.
Published: (2026)
by: Yang, Wenjie, et al.
Published: (2026)
Multi Teacher Privileged Knowledge Distillation for Multimodal Expression Recognition
by: Aslam, Muhammad Haseeb, et al.
Published: (2024)
by: Aslam, Muhammad Haseeb, et al.
Published: (2024)
On-Policy Distillation with Best-of-N Teacher Rollout Selection
by: Zhang, Ke, et al.
Published: (2026)
by: Zhang, Ke, et al.
Published: (2026)
SemanticVLA: Semantic-Aligned Sparsification and Enhancement for Efficient Robotic Manipulation
by: Li, Wei, et al.
Published: (2025)
by: Li, Wei, et al.
Published: (2025)
Language-Instructed Reasoning for Group Activity Detection via Multimodal Large Language Model
by: Peng, Jihua, et al.
Published: (2025)
by: Peng, Jihua, et al.
Published: (2025)
Towards Lossless Dataset Distillation via Difficulty-Aligned Trajectory Matching
by: Guo, Ziyao, et al.
Published: (2023)
by: Guo, Ziyao, et al.
Published: (2023)
Multimodal Mamba: Decoder-only Multimodal State Space Model via Quadratic to Linear Distillation
by: Liao, Bencheng, et al.
Published: (2025)
by: Liao, Bencheng, et al.
Published: (2025)
Enhancing Dataset Distillation via Label Inconsistency Elimination and Learning Pattern Refinement
by: Zhou, Chuhao, et al.
Published: (2024)
by: Zhou, Chuhao, et al.
Published: (2024)
Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention
by: Zhang, Wenhu, et al.
Published: (2026)
by: Zhang, Wenhu, et al.
Published: (2026)
Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model
by: Liu, Chenyang, et al.
Published: (2025)
by: Liu, Chenyang, et al.
Published: (2025)
SafeMVDrive: Multi-view Safety-Critical Driving Video Synthesis in the Real World Domain
by: Zhou, Jiawei, et al.
Published: (2025)
by: Zhou, Jiawei, et al.
Published: (2025)
Neural Spectral Decomposition for Dataset Distillation
by: Yang, Shaolei, et al.
Published: (2024)
by: Yang, Shaolei, et al.
Published: (2024)
LISA: Reasoning Segmentation via Large Language Model
by: Lai, Xin, et al.
Published: (2023)
by: Lai, Xin, et al.
Published: (2023)
Teacher-Guided Student Self-Knowledge Distillation Using Diffusion Model
by: Wang, Yu, et al.
Published: (2026)
by: Wang, Yu, et al.
Published: (2026)
AudioFace: Language-Assisted Speech-Driven Facial Animation with Multimodal Language Models
by: Zheng, Kai, et al.
Published: (2026)
by: Zheng, Kai, et al.
Published: (2026)
Similar Items
-
Mitigating Object Hallucinations via Sentence-Level Early Intervention
by: Peng, Shangpin, et al.
Published: (2025) -
Unified Language-driven Zero-shot Domain Adaptation
by: Yang, Senqiao, et al.
Published: (2024) -
Consistency Beyond Contrast: Enhancing Open-Vocabulary Object Detection Robustness via Contextual Consistency Learning
by: Li, Bozhao, et al.
Published: (2026) -
LISA++: An Improved Baseline for Reasoning Segmentation with Large Language Model
by: Yang, Senqiao, et al.
Published: (2023) -
Explore the Potential of CLIP for Training-Free Open Vocabulary Semantic Segmentation
by: Shao, Tong, et al.
Published: (2024)