01On-Device LLM · Main Pillar 主支柱
端侧大模型 主支柱 量化编译运行时
大模型不依赖云端也能跑。量化感知训练、PTQ/QLoRA 压缩、编译图优化与异构运行时一体化,支持 Transformer / Mamba / MoE 在 ARM、RISC-V、NPU 上低功耗推理,首 token < 500ms,断网可用、OTA 持续进化。
- 量化压缩:INT4/INT8/FP8 与 KV Cache 压缩,体积降 70%+ 精度损失 <1%
- 编译图优化:算子融合、内存规划与异构调度,端侧延时降低 3×
- 异构运行时:统一 Runtime 适配 CPU / GPU / NPU / DSP,零代码切换芯片
- 边云协同进化:云端训练、端侧增量微调与 OTA 热更新,样本回流持续迭代




