Spike-Aware INT8 Execution for Spiking Language Models on Commodity CPUs
cs.NE, cs.AI, cs.LG
Submitted: 2026-06-02
Updated: 2026-09-07
Comments: 13 pages, 3 figures, 11 tables. Revised presentation and evaluation; added numerical validation and an ARM wall-power case study; withdrawn invalid pure-INT4 results and clarified comparison protocols
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- SymbolicLight V1: Spike-Gated Dual-Path Language Modeling at High Encoder Spike Sparsity
- BitNet b1.58 2B4T Technical Report
- Bitnet.cpp: Efficient Edge Inference for Ternary LLMs
- SpikeGPT: Generative Pre-trained Language Model with Spiking Neural Networks
- Qwen2.5 Technical Report
- TinyLlama: An Open-Source Small Language Model
Related papers
- Evolutionary Ensemble of Agents
- Encoding and Decoding Temporal Signals with Spiking Bandpass Wavelets
- Large Language Models and Evolutionary Computation: A Critical Review of Bidirectional Interaction, Automated Algorithm Design, and Co-Adaptive Systems
- Learning Alzheimer's Disease Signatures by bridging EEG with Spiking Neural Networks and Biophysical Simulations
- Investigating Hyperparameter Optimization and Transferability for ES-HyperNEAT: A TPE Approach
- S-AI-Recursive: A Bio-Inspired and Temporal Sparse AI Architecture for Iterative, Introspective, and Energy-Frugal Reasoning