Data Processing Techniques for Modern Multimodal Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Yinheng, Ding, Han, Chen, Hang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
VideoWebArena: Evaluating Long Context Multimodal Agents with Video Understanding Web Tasks
por: Jang, Lawrence, et al.
Publicado: (2024)
por: Jang, Lawrence, et al.
Publicado: (2024)
Survey of Multimodal Geospatial Foundation Models: Techniques, Applications, and Challenges
por: Yang, Liling, et al.
Publicado: (2025)
por: Yang, Liling, et al.
Publicado: (2025)
Accelerating Data Processing and Benchmarking of AI Models for Pathology
por: Zhang, Andrew, et al.
Publicado: (2025)
por: Zhang, Andrew, et al.
Publicado: (2025)
SMART-Vision: Survey of Modern Action Recognition Techniques in Vision
por: AlShami, Ali K., et al.
Publicado: (2025)
por: AlShami, Ali K., et al.
Publicado: (2025)
Towards Unified Multimodal Interleaved Generation via Group Relative Policy Optimization
por: Nie, Ming, et al.
Publicado: (2026)
por: Nie, Ming, et al.
Publicado: (2026)
Img-Diff: Contrastive Data Synthesis for Multimodal Large Language Models
por: Jiao, Qirui, et al.
Publicado: (2024)
por: Jiao, Qirui, et al.
Publicado: (2024)
Mixup Helps Understanding Multimodal Video Better
por: Ma, Xiaoyu, et al.
Publicado: (2025)
por: Ma, Xiaoyu, et al.
Publicado: (2025)
Holistic Autonomous Driving Understanding by Bird's-Eye-View Injected Multi-Modal Large Models
por: Ding, Xinpeng, et al.
Publicado: (2024)
por: Ding, Xinpeng, et al.
Publicado: (2024)
LithoBench: Benchmarking Large Multimodal Models for Remote-Sensing Lithology Interpretation
por: Wang, Jun, et al.
Publicado: (2026)
por: Wang, Jun, et al.
Publicado: (2026)
CaMML: Context-Aware Multimodal Learner for Large Models
por: Chen, Yixin, et al.
Publicado: (2024)
por: Chen, Yixin, et al.
Publicado: (2024)
C2-Evo: Co-Evolving Multimodal Data and Model for Self-Improving Reasoning
por: Chen, Xiuwei, et al.
Publicado: (2025)
por: Chen, Xiuwei, et al.
Publicado: (2025)
GeminiFusion: Efficient Pixel-wise Multimodal Fusion for Vision Transformer
por: Jia, Ding, et al.
Publicado: (2024)
por: Jia, Ding, et al.
Publicado: (2024)
HiLM-D: Enhancing MLLMs with Multi-Scale High-Resolution Details for Autonomous Driving
por: Ding, Xinpeng, et al.
Publicado: (2023)
por: Ding, Xinpeng, et al.
Publicado: (2023)
EndoDDC: Learning Sparse to Dense Reconstruction for Endoscopic Robotic Navigation via Diffusion Depth Completion
por: Lin, Yinheng, et al.
Publicado: (2026)
por: Lin, Yinheng, et al.
Publicado: (2026)
Modeling and Measuring Redundancy in Multisource Multimodal Data for Autonomous Driving
por: Zhou, Yuhan, et al.
Publicado: (2026)
por: Zhou, Yuhan, et al.
Publicado: (2026)
Task-Focused Memorization for Multimodal Agents
por: Zou, Tao, et al.
Publicado: (2026)
por: Zou, Tao, et al.
Publicado: (2026)
VisualPRM: An Effective Process Reward Model for Multimodal Reasoning
por: Wang, Weiyun, et al.
Publicado: (2025)
por: Wang, Weiyun, et al.
Publicado: (2025)
Machine Learning Techniques for MRI Data Processing at Expanding Scale
por: Langner, Taro
Publicado: (2024)
por: Langner, Taro
Publicado: (2024)
Diff-SBSR: Learning Multimodal Feature-Enhanced Diffusion Models for Zero-Shot Sketch-Based 3D Shape Retrieval
por: Cheng, Hang, et al.
Publicado: (2026)
por: Cheng, Hang, et al.
Publicado: (2026)
Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
por: Chen, Zhe, et al.
Publicado: (2024)
por: Chen, Zhe, et al.
Publicado: (2024)
SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation
por: Ge, Yuying, et al.
Publicado: (2024)
por: Ge, Yuying, et al.
Publicado: (2024)
Multimodal Representation Learning Techniques for Comprehensive Facial State Analysis
por: Zheng, Kaiwen, et al.
Publicado: (2025)
por: Zheng, Kaiwen, et al.
Publicado: (2025)
MIRA: Multimodal Iterative Reasoning Agent for Image Editing
por: Zeng, Ziyun, et al.
Publicado: (2025)
por: Zeng, Ziyun, et al.
Publicado: (2025)
PaMi-VDPO: Mitigating Video Hallucinations by Prompt-Aware Multi-Instance Video Preference Learning
por: Ding, Xinpeng, et al.
Publicado: (2025)
por: Ding, Xinpeng, et al.
Publicado: (2025)
Multimodal Dataset Distillation via Phased Teacher Models
por: Guo, Shengbin, et al.
Publicado: (2026)
por: Guo, Shengbin, et al.
Publicado: (2026)
Unified Multimodal Models as Auto-Encoders
por: Yan, Zhiyuan, et al.
Publicado: (2025)
por: Yan, Zhiyuan, et al.
Publicado: (2025)
G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models
por: Li, Junxian, et al.
Publicado: (2026)
por: Li, Junxian, et al.
Publicado: (2026)
Unified Diffusion VLA: Vision-Language-Action Model via Joint Discrete Denoising Diffusion Process
por: Chen, Jiayi, et al.
Publicado: (2025)
por: Chen, Jiayi, et al.
Publicado: (2025)
Benchmarking Robustness of Multimodal Image-Text Models under Distribution Shift
por: Qiu, Jielin, et al.
Publicado: (2022)
por: Qiu, Jielin, et al.
Publicado: (2022)
MICON-Bench: Benchmarking and Enhancing Multi-Image Context Image Generation in Unified Multimodal Models
por: Wu, Mingrui, et al.
Publicado: (2026)
por: Wu, Mingrui, et al.
Publicado: (2026)
ReasonCD: A Multimodal Reasoning Large Model for Implicit Change-of-Interest Semantic Mining
por: Huang, Zhenyang, et al.
Publicado: (2025)
por: Huang, Zhenyang, et al.
Publicado: (2025)
Uncertainty-Aware Knowledge Distillation for Multimodal Large Language Models
por: Sun, Jingchen, et al.
Publicado: (2026)
por: Sun, Jingchen, et al.
Publicado: (2026)
A Survey on Wi-Fi Sensing Generalizability: Taxonomy, Techniques, Datasets, and Future Research Prospects
por: Wang, Fei, et al.
Publicado: (2025)
por: Wang, Fei, et al.
Publicado: (2025)
Optimizing ID Consistency in Multimodal Large Models: Facial Restoration via Alignment, Entanglement, and Disentanglement
por: Dong, Yuran, et al.
Publicado: (2026)
por: Dong, Yuran, et al.
Publicado: (2026)
FusDreamer: Label-efficient Remote Sensing World Model for Multimodal Data Classification
por: Wang, Jinping, et al.
Publicado: (2025)
por: Wang, Jinping, et al.
Publicado: (2025)
GSVA: Generalized Segmentation via Multimodal Large Language Models
por: Xia, Zhuofan, et al.
Publicado: (2023)
por: Xia, Zhuofan, et al.
Publicado: (2023)
Reducing Peak Memory Usage for Modern Multimodal Large Language Model Pipelines
por: Kim, Junwan, et al.
Publicado: (2026)
por: Kim, Junwan, et al.
Publicado: (2026)
LOKI: A Comprehensive Synthetic Data Detection Benchmark using Large Multimodal Models
por: Ye, Junyan, et al.
Publicado: (2024)
por: Ye, Junyan, et al.
Publicado: (2024)
VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding
por: Zhang, Boqiang, et al.
Publicado: (2025)
por: Zhang, Boqiang, et al.
Publicado: (2025)
Enhancing Vision-Language Compositional Understanding with Multimodal Synthetic Data
por: Li, Haoxin, et al.
Publicado: (2025)
por: Li, Haoxin, et al.
Publicado: (2025)
Ejemplares similares
-
VideoWebArena: Evaluating Long Context Multimodal Agents with Video Understanding Web Tasks
por: Jang, Lawrence, et al.
Publicado: (2024) -
Survey of Multimodal Geospatial Foundation Models: Techniques, Applications, and Challenges
por: Yang, Liling, et al.
Publicado: (2025) -
Accelerating Data Processing and Benchmarking of AI Models for Pathology
por: Zhang, Andrew, et al.
Publicado: (2025) -
SMART-Vision: Survey of Modern Action Recognition Techniques in Vision
por: AlShami, Ali K., et al.
Publicado: (2025) -
Towards Unified Multimodal Interleaved Generation via Group Relative Policy Optimization
por: Nie, Ming, et al.
Publicado: (2026)