HUAYUN IOT · 模型工具链 /iot/developers.html · 独立项目,与华云数科官网完全隔离 ·工具链总览 ·五段流程 ·CLI / SDK
MODEL TOOLCHAIN · 一站式 · 可复现 · 可量产

模型工具链
量化 → 编译 → 仿真 → 在环 → OTA

训练模型量产固件 的完整闭环。一次配置,五步自动流转;校准即量化、编译即优化、仿真即预演、在环即真测、OTA 即交付,让每一版模型都可追溯、可回滚、可规模化下发。

01 QUANTIZE
量化

INT8 / INT4 / FP16
PTQ · QAT

02 COMPILE
编译

图优化 · 融合
内存规划

03 SIMULATE
仿真

数值 · 时序
功耗预估

04 HIL
在环

真机 · 回放
全链路回归

05 OTA
OTA

差分 · 灰度
安全回滚

PIPELINE 总览

五步闭环,模型即交付物

每一步都产出可校验的中间产物:量化报告 → 编译产物 → 仿真报告 → 在环日志 → OTA 包,版本化管理,全程可追溯。

01

量化 Quantize

校准集驱动的混合精度量化,PTQ 一键压缩,QAT 精度微调,逐层误差可视化。

INT8INT4FP16KL / MSE
产出 model.int8.onnx + 量化报告
02

编译 Compile

面向芯片的图优化:算子融合、常量折叠、内存复用与调度,适配 NPU / MCU / DSP。

算子融合内存规划TVM / 自研
产出 model.hyb / .bin + 性能预估
03

仿真 Simulate

无需上板即可比对:逐层数值误差、cycle-accurate 时序、延迟与功耗预估。

逐层对比时序仿真功耗模型
产出 仿真报告 + 热力图
04

在环 HIL

真实硬件在环验证:板端 Profiler、日志回灌、异常帧复现与自动化回归。

Profiler日志回灌回归集
产出 在环日志 + 通过率
05

OTA 升级

面向海量设备的升级平面:差分增量、灰度分批、签名校验、断点续传与一键回滚。

差分灰度签名回滚
产出 OTA 差分包 + 发布单

FIVE STAGES · 五段详解

从实验室到产线,每一步都可度量

各阶段独立可运行,也可一键串联;失败可回退,产物可缓存,版本可对比。

01 — QUANTIZECalibration · PTQ · QAT

量化 精度几乎无损,体积压缩 4 倍

支持 PTQ 训练后量化QAT 量化感知训练 双路径。以校准集驱动分布统计,自动完成逐层敏感度分析与混合精度分配,输出可复现的量化报告。

  • 多精度 — INT8 / INT4 / FP16 / 混合精度,逐层可配置
  • 多算法 — KL、MSE、余弦、百分比截断,自动择优
  • 校准集 — 200~1k 张即收敛,支持隐私校准集本地化
  • 可视化 — 逐层 SNR / 余弦相似度 / 直方图,定位精度塌陷层
输入 INPUTFP32 ONNX / SavedModel
输出 OUTPUTINT8 ONNX + quantization.json
huayun quantize — PTQ误差 < 1%
# 1) 校准 + 量化(PTQ,200 张校准集)
huayun quantize \
  --model yolov8n.onnx \
  --calib coco_calib_500/ \
  --precision int8 --metric kl \
  --per-channel --export-report

# 报告:model_int8/quant_report.html
# 体积 12.4 MB → 3.2 MB (-74%)  mAP 0.412 → 0.408 (-0.97%)

# 2) QAT 微调(可选,精度回升)
huayun qat-train --config qat.yaml --epochs 3
02 — COMPILEGraph Opt · Memory Plan · Target

编译 为芯片而生,不为框架妥协

将量化后模型编译为目标硬件可执行产物。完成 算子融合、常量折叠、布局转换、内存复用与指令调度,同一模型可编译至多款芯片。

  • 图优化 — 融合 Conv-BN-ReLU、消除冗余算子,图节点 -18%
  • 内存规划 — 静态复用 + 动态池化,峰值内存 -35%
  • 多 Target — Cortex-M55 / RISC-V / 自研 NPU / DSP
  • 可验证 — 编译期 shape / dtype / 布局一致性校验
输入 INPUTINT8 ONNX + target.yaml
输出 OUTPUTmodel.hyb + model.bin + compile.json
看编译命令 →支持 TVM / 自研后端可插拔
huayun compile — 多 Target2.1 s 编译完成
huayun compile \
  --model yolov8n_int8.onnx \
  --target npu-v2 --opt O2 \
  --memory-plan reuse \
  --dump-perf

# Perf 预估 (NPU-v2 @ 1GHz)
# LAT  8.4 ms → 3.1 ms  (×2.7)
# MEM  4.8 MB → 3.1 MB
# OPS  融合 24 ops → 16 fused-ops

huayun compile --target cortex-m55 # 同一模型,秒级多编译
03 — SIMULATENumerical · Cycle-Accurate · Power

仿真 不上板,也能看见误差

在主机侧完成 数值仿真时序仿真,逐层对比量化前后张量,预估每层延迟与功耗。发现问题早于上板,节省 80% 调试轮次。

  • 数值比对 — 余弦、L2、KL,自动标红 Top-5 误差层
  • 时序仿真 — cycle-accurate,算子级延迟分解
  • 功耗预估 — 基于算子功率模型,mJ/帧预估
  • 可复现 — 仿真输入 / 随机种子 / 版本一并归档
输入 INPUT编译产物 + 仿真用例集
输出 OUTPUTsim_report.html + 数值热力图
huayun simulate — 逐层误差一致性 99.2%
huayun simulate \
  --artifact yolov8n_npu-v2.hyb \
  --samples val_200/ --mode numeric+timing

# 数值一致性
# cos_sim  mean 0.992  min 0.978 (layer 14)
# SNR      31.4 dB
# 时序 (详见报告)
#  Conv_12  0.42 ms  38%  |  DwConv 0.18 ms
open sim_report.html  # 热力图定位异常层
04 — HIL 在环Hardware-in-the-Loop · Profiler

在环 真机是唯一的真理

将编译产物下发至 真实开发板 / 模组 运行。板端 Profiler 采集逐层时延、内存、带宽与功耗,异常帧自动回灌至仿真侧复现。

  • 一键下发 — 串口 / USB / 以太网,自动识别板型
  • 板端 Profiler — 逐算子 latency / DDR 带宽 / NPU 利用率
  • 日志回灌 — 异常输入 + 中间张量回放到仿真
  • 回归集 — nightly HIL 流水线,版本级通过率看板
输入 INPUT编译产物 + HIL 设备池
输出 OUTPUTHIL 日志 + Profiler 火焰图
huayun hil — 真机 ProfilerHIL 通过 184/200
huayun hil run \
  --artifact yolov8n_npu-v2.hyb \
  --device npu-v2@192.168.1.10 \
  --samples val_200/ --profile

# HIL 结果
#  latency  p50 3.18 ms  p95 3.42 ms
#  accuracy mAP 0.406 (Δ -0.006 vs 仿真)
#  NPU 利用率 87%  DDR 1.2 GB/s
huayun hil replay --case fail_07.jpg  # 回灌复现
05 — OTADelta · Canary · Rollback · Signed

OTA 安全、可控、可回滚的规模化交付

面向海量设备的升级平面:差分增量 减小 90% 流量,灰度分批 控制爆炸半径,签名 + 验签 保障可信,断点续传 + 回滚 兜底可用。

  • 差分升级 — 二进制差分,平均包体积 < 15% 全量
  • 灰度策略 — 按地域 / 批次 / 1% → 10% → 100% 自动放量
  • 安全可信 — ECDSA 签名、TLS 传输、板端验签 + 防回滚
  • 可观测 — 升级成功率、失败码分布、自动熔断与回滚
输入 INPUT编译产物 + 版本基线
输出 OUTPUTOTA 差分包 + 发布单 + 看板
huayun ota — 灰度发布成功率 99.76%
huayun ota build \
  --artifact yolov8n_npu-v2.hyb \
  --from v2.3.0 --to v2.4.0 --diff

# diff  3.2 MB → 418 KB (-87%)  signed ✓

huayun ota rollout \
  --version v2.4.0 \
  --strategy canary:1%→10%→100% \
  --auto-rollback error>2%

huayun ota status v2.4.0  # 实时看板
−74%量化体积压缩INT8 · mAP 损失 < 1%
×2.7编译加速比图优化 + 算子融合
99.2%仿真一致性数值余弦相似度均值
99.76%OTA 到达率断点续传 · 千万级验证

CLI · SDK · API

一条流水线,贯通五段

本地 CLI 与云端构建一致;每段可独立执行,也可 一键串联。产物与报告版本化沉淀,支持缓存命中与断点续跑。

本地 / 云端一致

同一套 huayun CLI,本地调试与云端流水线行为完全一致。

缓存与复现

按模型哈希 + 配置哈希缓存,改一处只跑一处,秒级重跑。

版本化产物

每次运行生成可追溯的 run-id,量化/编译/仿真产物一并归档。

开放集成

提供 Python SDK 与 REST API,可嵌入 CI / CD 与自有 MLOps。

# huayun pipeline — 一键串联五段,可断点续跑
huayun pipeline run \
  --model yolov8n.onnx \
  --calib coco_calib_500/ \
  --target npu-v2 \
  --hil auto \
  --ota-diff --from v2.3.0

# 流水线日志
[quantize]  12.4 MB → 3.2 MB  mAP 0.412 → 0.408  ✓ 4.2s
[compile]   8.4 ms → 3.1 ms  mem -35%          ✓ 2.1s
[simulate]  cos 0.992  SNR 31.4 dB              ✓ 6.8s
[hil]       p50 3.18 ms  HIL 184/200            ✓ 42s
[ota]       diff 418 KB  signed                ✓ 1.1s
# 产物:runs/2026-05-13-a3f9/  报告:pipeline.html

让每一个模型,
都能稳稳跑在每一台设备上

量化、编译、仿真、在环、OTA —— 五步闭环已就绪。接入你的首个模型,30 分钟跑通全链路。

支持 ONNX · TensorFlow · PyTorch · Paddle · 私有格式可扩展