MiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal Interaction
Fuente:
arXiv
Saved in:
| Main Authors: | Cui, Junbo, Xu, Bokai, Wang, Chongyi, Yu, Tianyu, Sun, Weiyue, Xu, Yingjing, Wang, Tianran, He, Zhihui, Ma, Wenshuo, Cai, Tianchi, Gui, Jiancheng, Zhang, Luoyuan, Sun, Xian, Huang, Fuwei, Chen, Moye, Lin, Zhuo, Liu, Hanyu, Gui, Qingxin, Han, Qingzhe, Wen, Yuyang, Liu, Huiping, Wang, Rongkang, Zhang, Yaqi, Wei, Hongliang, Chen, Chi, Li, You, Fang, Kechen, Zhou, Jie, Li, Yuxuan, Zeng, Guoyang, Xiao, Chaojun, Lin, Yankai, Han, Xu, Sun, Maosong, Liu, Zhiyuan, Yao, Yuan |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
MiniCPM-V 4.5: Cooking Efficient MLLMs via Architecture, Data, and Training Recipe
by: Yu, Tianyu, et al.
Published: (2025)
by: Yu, Tianyu, et al.
Published: (2025)
MiniCPM-V: A GPT-4V Level MLLM on Your Phone
by: Yao, Yuan, et al.
Published: (2024)
by: Yao, Yuan, et al.
Published: (2024)
MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies
by: Hu, Shengding, et al.
Published: (2024)
by: Hu, Shengding, et al.
Published: (2024)
MiniCPM-SALA: Hybridizing Sparse and Linear Attention for Efficient Long-Context Modeling
by: MiniCPM Team, et al.
Published: (2026)
by: MiniCPM Team, et al.
Published: (2026)
MiniCPM4: Ultra-Efficient LLMs on End Devices
by: MiniCPM Team, et al.
Published: (2025)
by: MiniCPM Team, et al.
Published: (2025)
VoxCPM: Tokenizer-Free TTS for Context-Aware Speech Generation and True-to-Life Voice Cloning
by: Zhou, Yixuan, et al.
Published: (2025)
by: Zhou, Yixuan, et al.
Published: (2025)
LLaVA-UHD v4: What Makes Efficient Visual Encoding in MLLMs?
by: Fang, Kechen, et al.
Published: (2026)
by: Fang, Kechen, et al.
Published: (2026)
AgentCPM-GUI: Building Mobile-Use Agents with Reinforcement Fine-Tuning
by: Zhang, Zhong, et al.
Published: (2025)
by: Zhang, Zhong, et al.
Published: (2025)
Nigerian Speculative Fiction: The Evolution. By Chukwunonso, Ezeiyoke, New York: Routledge India, 2025. 226 pp. $34.69 (paperback). ISBN: 978‐1‐032‐95555‐1
by: Yingjing Xu, et al.
Published: (2026)
by: Yingjing Xu, et al.
Published: (2026)
The Afrofuturist Evolution: Creative Paths to Self‐Discovery. By Ytasha L.Womack, Chicago: Lawrence Hill Books, 2025. 321 pp. $19.99 (paperback). ISBN: 978‐0‐89733‐455‐6
by: Yingjing Xu
Published: (2025)
by: Yingjing Xu
Published: (2025)
Densing Law of LLMs
by: Xiao, Chaojun, et al.
Published: (2024)
by: Xiao, Chaojun, et al.
Published: (2024)
Iterative Equalization of CPM With Unitary Approximate Message Passing
by: Liu, Zilong, et al.
Published: (2024)
by: Liu, Zilong, et al.
Published: (2024)
InsightEdit: Towards Better Instruction Following for Image Editing
by: Xu, Yingjing, et al.
Published: (2024)
by: Xu, Yingjing, et al.
Published: (2024)
AgentCPM-Report: Interleaving Drafting and Deepening for Open-Ended Deep Research
by: Li, Yishan, et al.
Published: (2026)
by: Li, Yishan, et al.
Published: (2026)
On Bott--Samelson rings for Coxeter groups
by: Gui, Tao, et al.
Published: (2024)
by: Gui, Tao, et al.
Published: (2024)
InfLLM: Training-Free Long-Context Extrapolation for LLMs with an Efficient Context Memory
by: Xiao, Chaojun, et al.
Published: (2024)
by: Xiao, Chaojun, et al.
Published: (2024)
RNA Modification in Metabolism
by: Yadi Liu, et al.
Published: (2025)
by: Yadi Liu, et al.
Published: (2025)
CoPRIS: Efficient and Stable Reinforcement Learning via Concurrency-Controlled Partial Rollout with Importance Sampling
by: Qu, Zekai, et al.
Published: (2025)
by: Qu, Zekai, et al.
Published: (2025)
Towards Unified Task Embeddings Across Multiple Models: Bridging the Gap for Prompt-Based Large Language Models and Beyond
by: Wang, Xinyu, et al.
Published: (2024)
by: Wang, Xinyu, et al.
Published: (2024)
COPR: Continual Learning Human Preference through Optimal Policy Regularization
by: Zhang, Han, et al.
Published: (2023)
by: Zhang, Han, et al.
Published: (2023)
When Transformers Meet Recommenders: Integrating Self-Attentive Sequential Recommendation with Fine-Tuned LLMs
by: Liu, Kechen
Published: (2025)
by: Liu, Kechen
Published: (2025)
Building A Proof-Oriented Programmer That Is 64% Better Than GPT-4o Under Data Scarcity
by: Zhang, Dylan, et al.
Published: (2025)
by: Zhang, Dylan, et al.
Published: (2025)
Machine learning in weekly movement prediction
by: Gui, Han
Published: (2024)
by: Gui, Han
Published: (2024)
VisRAG: Vision-based Retrieval-augmented Generation on Multi-modality Documents
by: Yu, Shi, et al.
Published: (2024)
by: Yu, Shi, et al.
Published: (2024)
CPM: Class-conditional Prompting Machine for Audio-visual Segmentation
by: Chen, Yuanhong, et al.
Published: (2024)
by: Chen, Yuanhong, et al.
Published: (2024)
Ouroboros: Generating Longer Drafts Phrase by Phrase for Faster Speculative Decoding
by: Zhao, Weilin, et al.
Published: (2024)
by: Zhao, Weilin, et al.
Published: (2024)
Atmos-Bench: 3D Atmospheric Structures for Climate Insight
by: Xu, Tianchi
Published: (2025)
by: Xu, Tianchi
Published: (2025)
\emph{FoQuS}: A Forgetting-Quality Coreset Selection Framework for Automatic Modulation Recognition
by: Lu, Yao, et al.
Published: (2025)
by: Lu, Yao, et al.
Published: (2025)
Omni-DuplexEval: Evaluating Real-time Duplex Omni-modal Interaction
by: He, Chaoqun, et al.
Published: (2026)
by: He, Chaoqun, et al.
Published: (2026)
A Lightweight Hybrid Dual Channel Speech Enhancement System under Low-SNR Conditions
by: Wang, Zheng, et al.
Published: (2025)
by: Wang, Zheng, et al.
Published: (2025)
Molecular evolution of stem cell regulators driving powerful regenerative abilities in plants
by: Gui Cai, et al.
Published: (2026)
by: Gui Cai, et al.
Published: (2026)
ICAS: IP Adapter and ControlNet-based Attention Structure for Multi-Subject Style Transfer Optimization
by: Liu, Fuwei
Published: (2025)
by: Liu, Fuwei
Published: (2025)
Data-Free Class-Incremental Gesture Recognition with Prototype-Guided Pseudo Feature Replay
by: Wang, Hongsong, et al.
Published: (2025)
by: Wang, Hongsong, et al.
Published: (2025)
Locret: Enhancing Eviction in Long-Context LLM Inference with Trained Retaining Heads on Consumer-Grade Devices
by: Huang, Yuxiang, et al.
Published: (2024)
by: Huang, Yuxiang, et al.
Published: (2024)
SkinGEN: an Explainable Dermatology Diagnosis-to-Generation Framework with Interactive Vision-Language Models
by: Lin, Bo, et al.
Published: (2024)
by: Lin, Bo, et al.
Published: (2024)
AdPO: Enhancing the Adversarial Robustness of Large Vision-Language Models with Preference Optimization
by: Liu, Chaohu, et al.
Published: (2025)
by: Liu, Chaohu, et al.
Published: (2025)
Coupling of Defective VSe 2‐x with Graphene via V─C Bonds for High‐Rate and Long‐Life Sodium‐Ion Storage
by: Gui Xu, et al.
Published: (2025)
by: Gui Xu, et al.
Published: (2025)
Calibrating Car-Following Models via Bayesian Dynamic Regression
by: Zhang, Chengyuan, et al.
Published: (2023)
by: Zhang, Chengyuan, et al.
Published: (2023)
Machine Learning‐Driven Molecular Dynamics Study of LiF‐SmF3 Molten Salts
by: Fei Liu, et al.
Published: (2025)
by: Fei Liu, et al.
Published: (2025)
Integrating emotion dynamics in mental health: A trimodal framework combining ecological momentary assessment, physiological measurements, and speech emotion recognition
by: Peng Wang, et al.
Published: (2025)
by: Peng Wang, et al.
Published: (2025)
Similar Items
-
MiniCPM-V 4.5: Cooking Efficient MLLMs via Architecture, Data, and Training Recipe
by: Yu, Tianyu, et al.
Published: (2025) -
MiniCPM-V: A GPT-4V Level MLLM on Your Phone
by: Yao, Yuan, et al.
Published: (2024) -
MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies
by: Hu, Shengding, et al.
Published: (2024) -
MiniCPM-SALA: Hybridizing Sparse and Linear Attention for Efficient Long-Context Modeling
by: MiniCPM Team, et al.
Published: (2026) -
MiniCPM4: Ultra-Efficient LLMs on End Devices
by: MiniCPM Team, et al.
Published: (2025)