A Survey: Collaborative Hardware and Software Design in the Era of Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Guo, Cong, Cheng, Feng, Du, Zhixu, Kiessling, James, Ku, Jonathan, Li, Shiyu, Li, Ziru, Ma, Mingyuan, Molom-Ochir, Tergel, Morris, Benjamin, Shan, Haoxuan, Sun, Jingwei, Wang, Yitu, Wei, Chiyue, Wu, Xueying, Wu, Yuhao, Yang, Hao Frank, Zhang, Jingyang, Zhang, Junyao, Zheng, Qilin, Zhou, Guanglei, Hai, Li, Chen, Yiran |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
MonoSparse-CAM: Efficient Tree Model Processing via Monotonicity and Sparsity in CAMs
by: Molom-Ochir, Tergel, et al.
Published: (2024)
by: Molom-Ochir, Tergel, et al.
Published: (2024)
End-to-End Transformer Acceleration Through Processing-in-Memory Architectures
by: Yang, Xiaoxuan, et al.
Published: (2025)
by: Yang, Xiaoxuan, et al.
Published: (2025)
ModSRAM: Algorithm-Hardware Co-Design for Large Number Modular Multiplication in SRAM
by: Ku, Jonathan, et al.
Published: (2024)
by: Ku, Jonathan, et al.
Published: (2024)
Hamming Attention Distillation: Binarizing Keys and Queries for Efficient Long-Context Transformers
by: Horton, Mark, et al.
Published: (2025)
by: Horton, Mark, et al.
Published: (2025)
CAMformer: Associative Memory is All You Need
by: Molom-Ochir, Tergel, et al.
Published: (2025)
by: Molom-Ochir, Tergel, et al.
Published: (2025)
SiDA-MoE: Sparsity-Inspired Data-Aware Serving for Efficient and Scalable Large Mixture-of-Experts Models
by: Du, Zhixu, et al.
Published: (2023)
by: Du, Zhixu, et al.
Published: (2023)
Platinum: Path-Adaptable LUT-Based Accelerator Tailored for Low-Bit Weight Matrix Multiplication
by: Shan, Haoxuan, et al.
Published: (2025)
by: Shan, Haoxuan, et al.
Published: (2025)
NDSEARCH: Accelerating Graph-Traversal-Based Approximate Nearest Neighbor Search through Near Data Processing
by: Wang, Yitu, et al.
Published: (2023)
by: Wang, Yitu, et al.
Published: (2023)
AutoRAC: Automated Processing-in-Memory Accelerator Design for Recommender Systems
by: Cheng, Feng, et al.
Published: (2025)
by: Cheng, Feng, et al.
Published: (2025)
Knowledge Graph Tuning: Real-time Large Language Model Personalization based on Human Feedback
by: Sun, Jingwei, et al.
Published: (2024)
by: Sun, Jingwei, et al.
Published: (2024)
Phi: Leveraging Pattern-based Hierarchical Sparsity for High-Efficiency Spiking Neural Networks
by: Wei, Chiyue, et al.
Published: (2025)
by: Wei, Chiyue, et al.
Published: (2025)
Focus: A Streaming Concentration Architecture for Efficient Vision-Language Models
by: Wei, Chiyue, et al.
Published: (2025)
by: Wei, Chiyue, et al.
Published: (2025)
qGDP: Quantum Legalization and Detailed Placement for Superconducting Quantum Computers
by: Zhang, Junyao, et al.
Published: (2024)
by: Zhang, Junyao, et al.
Published: (2024)
FedProphet: Memory-Efficient Federated Adversarial Training via Robust and Consistent Cascade Learning
by: Tang, Minxue, et al.
Published: (2024)
by: Tang, Minxue, et al.
Published: (2024)
AutoEDA: Enabling EDA Flow Automation through Microservice-Based LLM Agents
by: Lu, Yiyi, et al.
Published: (2025)
by: Lu, Yiyi, et al.
Published: (2025)
Enhance Quantum Teleportation with Multi-Axis Measurement
by: Zhang, Junyao, et al.
Published: (2026)
by: Zhang, Junyao, et al.
Published: (2026)
LoBAM: LoRA-Based Backdoor Attack on Model Merging
by: Yin, Ming, et al.
Published: (2024)
by: Yin, Ming, et al.
Published: (2024)
Prosperity: Accelerating Spiking Neural Networks via Product Sparsity
by: Wei, Chiyue, et al.
Published: (2025)
by: Wei, Chiyue, et al.
Published: (2025)
Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-aware Cache Compression
by: Cheng, Feng, et al.
Published: (2025)
by: Cheng, Feng, et al.
Published: (2025)
SD-NAE: Generating Natural Adversarial Examples with Stable Diffusion
by: Lin, Yueqian, et al.
Published: (2023)
by: Lin, Yueqian, et al.
Published: (2023)
Neonatal Liver‐Specific UBA3 Deficiency Leads to TNF‐α‐Dependent Necroptosis of Liver Sinusoidal Endothelial Cells During Cyst Formation
by: Jiaqin Wang, et al.
Published: (2025)
by: Jiaqin Wang, et al.
Published: (2025)
MoE-GPS: Guidlines for Prediction Strategy for Dynamic Expert Duplication in MoE Load Balancing
by: Ma, Haiyue, et al.
Published: (2025)
by: Ma, Haiyue, et al.
Published: (2025)
SpeechPrune: Context-aware Token Pruning for Speech Information Retrieval
by: Lin, Yueqian, et al.
Published: (2024)
by: Lin, Yueqian, et al.
Published: (2024)
EVA: Recasting LLM Decoding into GEMM via an Efficient Vector Quantization Architecture
by: Duan, Bowen, et al.
Published: (2026)
by: Duan, Bowen, et al.
Published: (2026)
EVA: Accelerating LLM Decoding via an Efficient Vector Quantization Architecture
by: Duan, Bowen, et al.
Published: (2026)
by: Duan, Bowen, et al.
Published: (2026)
Ligand‐Field Splitting Parameter Optimization Achieves Synergistic Enhancement of Transition Metal Redox Activity and Structural Stability in High‐Voltage Sodium Layered Oxide Cathodes
by: Qiannan Zhou, et al.
Published: (2025)
by: Qiannan Zhou, et al.
Published: (2025)
Surface Structured Quadrilateral Mesh Generation Based on Topology Consistent‐Preserved Patch Segmentation
by: Haoxuan Zhang, et al.
Published: (2024)
by: Haoxuan Zhang, et al.
Published: (2024)
Keyframe-oriented Vision Token Pruning: Enhancing Efficiency of Large Vision Language Models on Long-Form Video Processing
by: Liu, Yudong, et al.
Published: (2025)
by: Liu, Yudong, et al.
Published: (2025)
Gold‐catalyzed endo‐selective Ring‐opening of Epoxides and its Application in Construction of Poly‐ethers
by: Kehuan Wu, et al.
Published: (2024)
by: Kehuan Wu, et al.
Published: (2024)
A New Way: Kronecker-Factored Approximate Curvature Deep Hedging and its Benefits
by: Enkhbayar, Tsogt-Ochir
Published: (2024)
by: Enkhbayar, Tsogt-Ochir
Published: (2024)
Which Sparse Autoencoder Features Are Real? Model-X Knockoffs for False Discovery Rate Control
by: Enkhbayar, Tsogt-Ochir
Published: (2025)
by: Enkhbayar, Tsogt-Ochir
Published: (2025)
Learning from Negative Examples: Why Warning-Framed Training Data Teaches What It Warns Against
by: Enkhbayar, Tsogt-Ochir
Published: (2025)
by: Enkhbayar, Tsogt-Ochir
Published: (2025)
Atomic Literary Styling: Mechanistic Manipulation of Prose Generation in Neural Language Models
by: Enkhbayar, Tsogt-Ochir
Published: (2025)
by: Enkhbayar, Tsogt-Ochir
Published: (2025)
KLLM: Fast LLM Inference with K-Means Quantization
by: Wu, Xueying, et al.
Published: (2025)
by: Wu, Xueying, et al.
Published: (2025)
PIDS: Joint Point Interaction-Dimension Search for 3D Point Cloud
by: Zhang, Tunhou, et al.
Published: (2022)
by: Zhang, Tunhou, et al.
Published: (2022)
The Impact of Regional Vegetation Heterogeneity on the Runoff and Sediment Effects of Future Climate Change
by: Lei Wu, et al.
Published: (2026)
by: Lei Wu, et al.
Published: (2026)
Large Language Model Aided QoS Prediction for Service Recommendation
by: Liu, Huiying, et al.
Published: (2024)
by: Liu, Huiying, et al.
Published: (2024)
Transitive Array: An Efficient GEMM Accelerator with Result Reuse
by: Guo, Cong, et al.
Published: (2025)
by: Guo, Cong, et al.
Published: (2025)
MUSE: A Run-Centric Platform for Multimodal Unified Safety Evaluation of Large Language Models
by: Wang, Zhongxi, et al.
Published: (2026)
by: Wang, Zhongxi, et al.
Published: (2026)
Real-time Position Reconstruction for the KamLAND-Zen Experiment using Hardware-AI Co-design
by: Migala, Alexander, et al.
Published: (2024)
by: Migala, Alexander, et al.
Published: (2024)
Similar Items
-
MonoSparse-CAM: Efficient Tree Model Processing via Monotonicity and Sparsity in CAMs
by: Molom-Ochir, Tergel, et al.
Published: (2024) -
End-to-End Transformer Acceleration Through Processing-in-Memory Architectures
by: Yang, Xiaoxuan, et al.
Published: (2025) -
ModSRAM: Algorithm-Hardware Co-Design for Large Number Modular Multiplication in SRAM
by: Ku, Jonathan, et al.
Published: (2024) -
Hamming Attention Distillation: Binarizing Keys and Queries for Efficient Long-Context Transformers
by: Horton, Mark, et al.
Published: (2025) -
CAMformer: Associative Memory is All You Need
by: Molom-Ochir, Tergel, et al.
Published: (2025)