AutoNeural: Co-Designing Vision-Language Models for NPU Inference
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Chen, Wei, Wu, Liangmin, Hu, Yunhai, Li, Zhiyuan, Cheng, Zhiyuan, Qian, Yicheng, Zhu, Lingyue, Hu, Zhipeng, Liang, Luoyi, Tang, Qiang, Liu, Zhen, Yang, Han |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
NPU Design for Diffusion Language Model Inference
von: Lou, Binglei, et al.
Veröffentlicht: (2026)
von: Lou, Binglei, et al.
Veröffentlicht: (2026)
ShadowNPU: System and Algorithm Co-design for NPU-Centric On-Device LLM Inference
von: Yin, Wangsong, et al.
Veröffentlicht: (2025)
von: Yin, Wangsong, et al.
Veröffentlicht: (2025)
Auto-ACD: A Large-scale Dataset for Audio-Language Representation Learning
von: Sun, Luoyi, et al.
Veröffentlicht: (2023)
von: Sun, Luoyi, et al.
Veröffentlicht: (2023)
OmniVLM: A Token-Compressed, Sub-Billion-Parameter Vision-Language Model for Efficient On-Device Inference
von: Chen, Wei, et al.
Veröffentlicht: (2024)
von: Chen, Wei, et al.
Veröffentlicht: (2024)
Finite State Machines-Based Path-Following Collaborative Computing Strategy for Emergency UAV Swarms
von: Hu, Jialin, et al.
Veröffentlicht: (2024)
von: Hu, Jialin, et al.
Veröffentlicht: (2024)
Backdoor Attack on Vision Language Models with Stealthy Semantic Manipulation
von: Zhong, Zhiyuan, et al.
Veröffentlicht: (2025)
von: Zhong, Zhiyuan, et al.
Veröffentlicht: (2025)
Recurrent Auto-Encoder Model for Large-Scale Industrial Sensor Signal Analysis
von: Wong, Timothy, et al.
Veröffentlicht: (2018)
von: Wong, Timothy, et al.
Veröffentlicht: (2018)
TriGen: NPU Architecture for End-to-End Acceleration of Large Language Models based on SW-HW Co-Design
von: Lee, Jonghun, et al.
Veröffentlicht: (2026)
von: Lee, Jonghun, et al.
Veröffentlicht: (2026)
Accelerating OpenPangu Inference on NPU via Speculative Decoding
von: Dai, Yuntao, et al.
Veröffentlicht: (2026)
von: Dai, Yuntao, et al.
Veröffentlicht: (2026)
From Characterization to Microarchitecture: Designing an Elegant and Reliable BFP-Based NPU
von: Zhang, Jie, et al.
Veröffentlicht: (2026)
von: Zhang, Jie, et al.
Veröffentlicht: (2026)
Dual Memory Networks: A Versatile Adaptation Approach for Vision-Language Models
von: Zhang, Yabin, et al.
Veröffentlicht: (2024)
von: Zhang, Yabin, et al.
Veröffentlicht: (2024)
From Buffers to Registers: Unlocking Fine-Grained FlashAttention with Hybrid-Bonded 3D NPU Co-Design
von: Yu, Jinxin, et al.
Veröffentlicht: (2026)
von: Yu, Jinxin, et al.
Veröffentlicht: (2026)
The NPU-ASLP-LiAuto System Description for Visual Speech Recognition in CNVSRC 2023
von: Wang, He, et al.
Veröffentlicht: (2024)
von: Wang, He, et al.
Veröffentlicht: (2024)
Distributed Computing for Huge-Scale Linear Programming
von: Tao, Luoyi
Veröffentlicht: (2024)
von: Tao, Luoyi
Veröffentlicht: (2024)
Distributed Computing for Huge-Scale Aggregative Convex Programming
von: Tao, Luoyi
Veröffentlicht: (2026)
von: Tao, Luoyi
Veröffentlicht: (2026)
Inference for calendar effects in microstructure noise
von: Yingwen Tan, et al.
Veröffentlicht: (2024)
von: Yingwen Tan, et al.
Veröffentlicht: (2024)
Closed-Loop Vision-Language Planning for Multi-Agent Coordination
von: Li, Zhiyuan, et al.
Veröffentlicht: (2025)
von: Li, Zhiyuan, et al.
Veröffentlicht: (2025)
To See is Not to Learn: Protecting Multimodal Data from Unauthorized Fine-Tuning of Large Vision-Language Model
von: Zhao, Chengshuai, et al.
Veröffentlicht: (2026)
von: Zhao, Chengshuai, et al.
Veröffentlicht: (2026)
NeuPIMs: NPU-PIM Heterogeneous Acceleration for Batched LLM Inferencing
von: Heo, Guseul, et al.
Veröffentlicht: (2024)
von: Heo, Guseul, et al.
Veröffentlicht: (2024)
Revisiting the Generalization Problem of Low-level Vision Models Through the Lens of Image Deraining
von: Hu, Jinfan, et al.
Veröffentlicht: (2025)
von: Hu, Jinfan, et al.
Veröffentlicht: (2025)
AutoFAIR : Automatic Data FAIRification via Machine Reading
von: Ma, Tingyan, et al.
Veröffentlicht: (2024)
von: Ma, Tingyan, et al.
Veröffentlicht: (2024)
Neural Residual Diffusion Models for Deep Scalable Vision Generation
von: Ma, Zhiyuan, et al.
Veröffentlicht: (2024)
von: Ma, Zhiyuan, et al.
Veröffentlicht: (2024)
Reading the Cell, Designing the Cure: Perturbation-Conditioned Molecular Diffusion for Function-Oriented Drug Design
von: Xu, Ziyu, et al.
Veröffentlicht: (2026)
von: Xu, Ziyu, et al.
Veröffentlicht: (2026)
Exploring Depth Generalization in Large Language Models for Solving Recursive Logic Tasks
von: He, Zhiyuan
Veröffentlicht: (2025)
von: He, Zhiyuan
Veröffentlicht: (2025)
Evaluating the Energy Efficiency of NPU-Accelerated Machine Learning Inference on Embedded Microcontrollers
von: Fanariotis, Anastasios, et al.
Veröffentlicht: (2025)
von: Fanariotis, Anastasios, et al.
Veröffentlicht: (2025)
Abduct, Act, Predict: Scaffolding Causal Inference for Automated Failure Attribution in Multi-Agent Systems
von: West, Alva, et al.
Veröffentlicht: (2025)
von: West, Alva, et al.
Veröffentlicht: (2025)
Graph Neural Networks Automated Design and Deployment on Device-Edge Co-Inference Systems
von: Zhou, Ao, et al.
Veröffentlicht: (2024)
von: Zhou, Ao, et al.
Veröffentlicht: (2024)
Simple Token-Efficient Vision-Language Model for Case-level Pathology Synoptic Report Generation
von: Yang, Zhiyuan, et al.
Veröffentlicht: (2026)
von: Yang, Zhiyuan, et al.
Veröffentlicht: (2026)
AutoEval: Autonomous Evaluation of Generalist Robot Manipulation Policies in the Real World
von: Zhou, Zhiyuan, et al.
Veröffentlicht: (2025)
von: Zhou, Zhiyuan, et al.
Veröffentlicht: (2025)
SPR-128K: A New Benchmark for Spatial Plausibility Reasoning with Multimodal Large Language Models
von: Hu, Zhiyuan, et al.
Veröffentlicht: (2025)
von: Hu, Zhiyuan, et al.
Veröffentlicht: (2025)
Towards Efficient Agents: A Co-Design of Inference Architecture and System
von: Lin, Weizhe, et al.
Veröffentlicht: (2025)
von: Lin, Weizhe, et al.
Veröffentlicht: (2025)
CoVSpec: Efficient Device-Edge Co-Inference for Vision-Language Models via Speculative Decoding
von: Jia, Yuanyuan, et al.
Veröffentlicht: (2026)
von: Jia, Yuanyuan, et al.
Veröffentlicht: (2026)
Generate Logical Equivalence Questions
von: Wang, Xinyu, et al.
Veröffentlicht: (2025)
von: Wang, Xinyu, et al.
Veröffentlicht: (2025)
Beyond Paper-to-Paper: Structured Profiling and Rubric Scoring for Paper-Reviewer Matching
von: Pan, Yicheng, et al.
Veröffentlicht: (2026)
von: Pan, Yicheng, et al.
Veröffentlicht: (2026)
Automatic question generation for propositional logical equivalences
von: Yang, Yicheng, et al.
Veröffentlicht: (2024)
von: Yang, Yicheng, et al.
Veröffentlicht: (2024)
Temporal-Oriented Recipe for Transferring Large Vision-Language Model to Video Understanding
von: Nguyen, Thong, et al.
Veröffentlicht: (2025)
von: Nguyen, Thong, et al.
Veröffentlicht: (2025)
Neural Architecture Search of Hybrid Models for NPU-CIM Heterogeneous AR/VR Devices
von: Zhao, Yiwei, et al.
Veröffentlicht: (2024)
von: Zhao, Yiwei, et al.
Veröffentlicht: (2024)
CREATOR: Tool Creation for Disentangling Abstract and Concrete Reasoning of Large Language Models
von: Qian, Cheng, et al.
Veröffentlicht: (2023)
von: Qian, Cheng, et al.
Veröffentlicht: (2023)
Utility-Aware Progressive Inference over UDP Packet Blocks for Emergency Communications
von: Wang, Jiayue, et al.
Veröffentlicht: (2026)
von: Wang, Jiayue, et al.
Veröffentlicht: (2026)
Cleaner Pretraining Corpus Curation with Neural Web Scraping
von: Xu, Zhipeng, et al.
Veröffentlicht: (2024)
von: Xu, Zhipeng, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
NPU Design for Diffusion Language Model Inference
von: Lou, Binglei, et al.
Veröffentlicht: (2026) -
ShadowNPU: System and Algorithm Co-design for NPU-Centric On-Device LLM Inference
von: Yin, Wangsong, et al.
Veröffentlicht: (2025) -
Auto-ACD: A Large-scale Dataset for Audio-Language Representation Learning
von: Sun, Luoyi, et al.
Veröffentlicht: (2023) -
OmniVLM: A Token-Compressed, Sub-Billion-Parameter Vision-Language Model for Efficient On-Device Inference
von: Chen, Wei, et al.
Veröffentlicht: (2024) -
Finite State Machines-Based Path-Following Collaborative Computing Strategy for Emergency UAV Swarms
von: Hu, Jialin, et al.
Veröffentlicht: (2024)