Accelerating HDC-CNN Hybrid Models Using Custom Instructions on RISC-V GPUs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Matsumi, Wakuto, Mian, Riaz-Ul-Haque |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
GPU Volume Rendering with Hierarchical Compression Using VDB
par: Zellmann, Stefan, et autres
Publié: (2025)
par: Zellmann, Stefan, et autres
Publié: (2025)
Towards Real-Time Neural Volumetric Rendering on Mobile Devices: A Measurement Study
par: Wang, Zhe, et autres
Publié: (2024)
par: Wang, Zhe, et autres
Publié: (2024)
AIvaluateXR: An Evaluation Framework for on-Device AI in XR with Benchmarking Results
par: Khan, Dawar, et autres
Publié: (2025)
par: Khan, Dawar, et autres
Publié: (2025)
Capsule: Efficient Player Isolation for Datacenters
par: Du, Zhouheng, et autres
Publié: (2025)
par: Du, Zhouheng, et autres
Publié: (2025)
GALE: Leveraging Heterogeneous Systems for Efficient Unstructured Mesh Data Analysis
par: Liu, Guoxi, et autres
Publié: (2025)
par: Liu, Guoxi, et autres
Publié: (2025)
An efficient GPU approach for designing 3D cultural heritage information systems
par: López, Luis, et autres
Publié: (2025)
par: López, Luis, et autres
Publié: (2025)
Fast Sparse Matrix Permutation for Mesh-Based Direct Solvers
par: Zarebavami, Behrooz, et autres
Publié: (2026)
par: Zarebavami, Behrooz, et autres
Publié: (2026)
RAFI -- A Ray/Work Forwarding Infrastructure for Data Parallel Multi-Node/Multi-GPU Computing
par: Wald, Ingo, et autres
Publié: (2026)
par: Wald, Ingo, et autres
Publié: (2026)
MSz: An Efficient Parallel Algorithm for Correcting Morse-Smale Segmentations in Error-Bounded Lossy Compressors
par: Li, Yuxiao, et autres
Publié: (2024)
par: Li, Yuxiao, et autres
Publié: (2024)
Barrier-Augmented Lagrangian for GPU-based Elastodynamic Contact
par: Guo, Dewen, et autres
Publié: (2024)
par: Guo, Dewen, et autres
Publié: (2024)
Exploiting ray tracing technology through OptiX to compute particle interactions with cutoff in a 3D environment on GPU
par: David, Algis, et autres
Publié: (2024)
par: David, Algis, et autres
Publié: (2024)
NeRF-XL: Scaling NeRFs with Multiple GPUs
par: Li, Ruilong, et autres
Publié: (2024)
par: Li, Ruilong, et autres
Publié: (2024)
Story of Two GPUs: Characterizing the Resilience of Hopper H100 and Ampere A100 GPUs
par: Cui, Shengkun, et autres
Publié: (2025)
par: Cui, Shengkun, et autres
Publié: (2025)
Accelerating Large Language Model Training with Hybrid GPU-based Compression
par: Xu, Lang, et autres
Publié: (2024)
par: Xu, Lang, et autres
Publié: (2024)
Opara: Exploiting Operator Parallelism for Expediting DNN Inference on GPUs
par: Chen, Aodong, et autres
Publié: (2023)
par: Chen, Aodong, et autres
Publié: (2023)
Training LLMs with Fault Tolerant HSDP on 100,000 GPUs
par: Salpekar, Omkar, et autres
Publié: (2026)
par: Salpekar, Omkar, et autres
Publié: (2026)
A Nonlinear Hash-based Optimization Method for SpMV on GPUs
par: Yan, Chen, et autres
Publié: (2025)
par: Yan, Chen, et autres
Publié: (2025)
Accelerating stencils on the Tenstorrent Grayskull RISC-V accelerator
par: Brown, Nick, et autres
Publié: (2024)
par: Brown, Nick, et autres
Publié: (2024)
Characterizing Performance-Energy Trade-offs of Large Language Models in Multi-Request Workflows
par: Ifath, Md. Monzurul Amin, et autres
Publié: (2026)
par: Ifath, Md. Monzurul Amin, et autres
Publié: (2026)
Astra: Efficient and Money-saving Automatic Parallel Strategies Search on Heterogeneous GPUs
par: Wang, Peiran, et autres
Publié: (2025)
par: Wang, Peiran, et autres
Publié: (2025)
Arkade: k-Nearest Neighbor Search With Non-Euclidean Distances using GPU Ray Tracing
par: Mandarapu, Durga, et autres
Publié: (2023)
par: Mandarapu, Durga, et autres
Publié: (2023)
A Few GPUs, A Whole Lotta Scale: Faithful LLM Training Emulation with PrismLLM
par: Xi, Shaoke, et autres
Publié: (2026)
par: Xi, Shaoke, et autres
Publié: (2026)
Lightning Grasp: High Performance Procedural Grasp Synthesis with Contact Fields
par: Yin, Zhao-Heng, et autres
Publié: (2025)
par: Yin, Zhao-Heng, et autres
Publié: (2025)
Paris: A Decentralized Trained Open-Weight Diffusion Model
par: Jiang, Zhiying, et autres
Publié: (2025)
par: Jiang, Zhiying, et autres
Publié: (2025)
Energy Efficient Federated Learning with Hyperdimensional Computing (HDC)
par: Ding, Yahao, et autres
Publié: (2026)
par: Ding, Yahao, et autres
Publié: (2026)
DiffPhD: A Unified Differentiable Solver for Projective Heterogeneous Materials in Elastodynamics with Contact-Rich GPU-Acceleration
par: Lai, Shih-Yu, et autres
Publié: (2026)
par: Lai, Shih-Yu, et autres
Publié: (2026)
Confidential Computing on NVIDIA Hopper GPUs: A Performance Benchmark Study
par: Zhu, Jianwei, et autres
Publié: (2024)
par: Zhu, Jianwei, et autres
Publié: (2024)
FlashMLA-ETAP: Efficient Transpose Attention Pipeline for Accelerating MLA Inference on NVIDIA H20 GPUs
par: Dege, Pengcuo, et autres
Publié: (2025)
par: Dege, Pengcuo, et autres
Publié: (2025)
LR-CNN: Lightweight Row-centric Convolutional Neural Network Training for Memory Reduction
par: Wang, Zhigang, et autres
Publié: (2024)
par: Wang, Zhigang, et autres
Publié: (2024)
Understand and Accelerate Memory Processing Pipeline for Large Language Model Inference
par: He, Zifan, et autres
Publié: (2026)
par: He, Zifan, et autres
Publié: (2026)
Accelerating Maximal Biclique Enumeration on GPUs
par: Hsieh, Chou-Ying, et autres
Publié: (2024)
par: Hsieh, Chou-Ying, et autres
Publié: (2024)
SpecEE: Accelerating Large Language Model Inference with Speculative Early Exiting
par: Xu, Jiaming, et autres
Publié: (2025)
par: Xu, Jiaming, et autres
Publié: (2025)
A Survey on Large Language Model Acceleration based on KV Cache Management
par: Li, Haoyang, et autres
Publié: (2024)
par: Li, Haoyang, et autres
Publié: (2024)
iOS as Acceleration
par: Chen, Alexander K.
Publié: (2025)
par: Chen, Alexander K.
Publié: (2025)
Prompt-Aware Scheduling for Efficient Text-to-Image Inferencing System
par: Agarwal, Shubham, et autres
Publié: (2025)
par: Agarwal, Shubham, et autres
Publié: (2025)
Distributed Simulation of Large Multi-body Systems
par: Kale, Manas, et autres
Publié: (2024)
par: Kale, Manas, et autres
Publié: (2024)
HPC-based Solvers of Minimisation Problems for Signal Processing
par: Cammarasana, Simone, et autres
Publié: (2023)
par: Cammarasana, Simone, et autres
Publié: (2023)
A 4D Hybrid Algorithm to Scale Parallel Training to Thousands of GPUs
par: Singh, Siddharth, et autres
Publié: (2023)
par: Singh, Siddharth, et autres
Publié: (2023)
OrchMLLM: Orchestrate Multimodal Data with Batch Post-Balancing to Accelerate Multimodal Large Language Model Training
par: Zheng, Yijie, et autres
Publié: (2025)
par: Zheng, Yijie, et autres
Publié: (2025)
Accelerating LLM Inference with Precomputed Query Storage
par: Park, Jay H., et autres
Publié: (2025)
par: Park, Jay H., et autres
Publié: (2025)
Documents similaires
-
GPU Volume Rendering with Hierarchical Compression Using VDB
par: Zellmann, Stefan, et autres
Publié: (2025) -
Towards Real-Time Neural Volumetric Rendering on Mobile Devices: A Measurement Study
par: Wang, Zhe, et autres
Publié: (2024) -
AIvaluateXR: An Evaluation Framework for on-Device AI in XR with Benchmarking Results
par: Khan, Dawar, et autres
Publié: (2025) -
Capsule: Efficient Player Isolation for Datacenters
par: Du, Zhouheng, et autres
Publié: (2025) -
GALE: Leveraging Heterogeneous Systems for Efficient Unstructured Mesh Data Analysis
par: Liu, Guoxi, et autres
Publié: (2025)