华云数科,通向万物互联的智能世界 ·状态页 ·文档

Edge AI · 端侧智能

智能在端侧发生
大模型量化编译,毫秒级推理

端侧大模型为主支柱,量化、编译与运行时一体化,让 7B 级大模型在网关、工控机与终端芯片上离线运行、毫秒级响应。弱网自治、边云协同,数据不出园区也能持续进化。

LLM ON-DEVICE· QUANT· RUNTIME· CONNECT· CLOUD

端侧智能

五层能力,智能在端侧闭环

以端侧大模型为核心,贯通量化编译、无线连接、云端协同与应用开发,让推理发生在数据产生的地方。

01On-Device LLM · Main Pillar 主支柱

端侧大模型 主支柱 量化编译运行时

大模型不依赖云端也能跑。量化感知训练、PTQ/QLoRA 压缩、编译图优化与异构运行时一体化,支持 Transformer / Mamba / MoE 在 ARM、RISC-V、NPU 上低功耗推理,首 token < 500ms,断网可用、OTA 持续进化。

  • 量化压缩:INT4/INT8/FP8 与 KV Cache 压缩,体积降 70%+ 精度损失 <1%
  • 编译图优化:算子融合、内存规划与异构调度,端侧延时降低 3×
  • 异构运行时:统一 Runtime 适配 CPU / GPU / NPU / DSP,零代码切换芯片
  • 边云协同进化:云端训练、端侧增量微调与 OTA 热更新,样本回流持续迭代
端侧大模型 · 量化编译运行时示意
Edge LLM · 量化编译运行时

02Wireless Connectivity

无线连接

一站式接入多制式无线网络,为端侧推理提供稳定数据通道。4G/5G、NB-IoT、LoRa、Wi-Fi 按场景自由选择,端侧结果实时回传、弱网缓存续传,移动与偏远现场也能保持智能在线。

  • 多制式接入:蜂窝、低功耗广域网、Wi-Fi 与卫星通信按需选择
  • 智能网络适配:信号自检、频段优选与故障秒级切换
  • 端到端加密:TLS 双向认证,链路与推理数据全程加密
  • 消息发布 API:Publish/Subscribe 语义,端侧事件直达云端
无线连接 · 多制式网络接入示意
Link · 多制式网络

03Cloud Platform

云平台

多活架构承载海量设备与模型并发,事件总线与数据管道让端侧推理结果毫秒级上云,时序存储与模型仓支撑全量样本回流、全局训练与灰度分发。

  • 多活架构:跨可用区部署,故障秒级自动切换
  • 事件总线与数据管道:毫秒级消息路由,端侧事件实时上云
  • 模型分发中枢:模型版本、编译产物与灰度策略统一管理
  • 时序存储:高压缩、高并发写入,样本与推理日志长期留存
云平台 · 端云协同中枢示意
Cloud · 端云协同

04Management & Insight

管理洞察

覆盖端侧模型与设备全生命周期的管理中枢。注册、配置、升级、监控与洞察在一个控制台内完成,模型版本、在线率、推理时延与告警一目了然,让运维从被动响应走向主动治理。

  • 管理控制台:设备分组、模型版本与批量配置监控
  • 远程运维:远程调试、日志回传与分级告警
  • 安全合规:访问控制、审计日志与数据分级不出园区
  • 配置中心:推理参数集中下发与灰度生效 即将推出
管理洞察 · 端侧控制台示意
Ops · 端侧控制台

05Application Development

应用开发

把端侧智能变成业务应用。开放 API、SDK 与低代码工作台覆盖从原型到生产的全过程,端侧推理能力通过规则引擎与事件总线开箱即用,让团队把时间花在业务创新上。

  • 开放 API 与 SDK:REST API、多语言 SDK,端侧推理一键调用
  • 低代码蓝图:可视化编排端侧联动与业务流 BETA
  • 工作台 Workbench:推理面板、告警与报表一站完成
  • 命令行工具 CLI:脚本化批量管理模型与持续集成
应用开发 · 端侧智能工作台示意
Build · 端侧应用工作台
0%+
模型压缩率
0ms
首 token 时延 <500ms
0+
芯片 / NPU 适配

技术架构

四层架构,层层为端侧智能加速

从端侧推理到云端协同的完整技术栈,量化、编译与运行时贯穿每一层。

L1

设备层 · 端侧推理

传感器 · 控制器 · 智能网关,端侧大模型就近推理

让智能在端侧发生
L2

网络层

4G / 5G · NB-IoT · LoRa · Wi-Fi,多制式自适应接入

让推理结果实时回传
L3

平台层 · 编译分发

量化编译 · 模型仓 · 规则引擎 · 边云协同,一个平台承载全生命周期

让模型持续进化
L4

应用层

离线助手 · 园区质检 · 设备 Copilot · 智能告警,端侧模板开箱即用

让业务快速落地

让智能在端侧发生,
数据不出园区

预约端侧智能演示,我们的专家将为你定制量化、编译到运行时的一体化方案。

Capability Map

五层能力,对应的不是功能,而是业务结果

端侧智能最终要落到可感知的结果上。我们按层拆解每一项能力对应解决的业务问题。

能力层核心能力典型场景业务结果
端侧大模型 主支柱量化、编译、运行时一体化园区离线助手 / 质检 Copilot推理不出园区、首 token <500ms
无线连接4G/5G/NB-IoT/LoRa/Wi-Fi分布式资产与移动终端接入弱网与移动场景推理不断线
云平台多活、模型分发、时序存储百万级端侧节点协同模型灰度分发、样本不丢
管理洞察生命周期、监控、运维跨站点端侧节点管理减少现场跑动与人工巡检
应用开发低代码、API、Web IDE端侧智能业务快速集成交付周期从月级到周级
Architecture

四层架构,层层都有端侧加速设计

设备层负责端侧推理、网络层保障实时回传、平台层负责量化编译与分发、应用层让端侧能力快速进入业务流程。

DEVICE

设备层 · 端侧推理

多平台 SDK、异构 Runtime 与离线缓存,让终端具备自治推理与容错能力。

NETWORK

网络层

多网融合与链路监测,推理结果弱网可缓存、恢复后批量同步。

PLATFORM

平台层 · 编译分发

量化、编译产物统一管理,多活集群与弹性伸缩保证高可用分发。

APP

应用层

开放 API 与低代码工具,让端侧推理数据快速进入业务流程。

FAQ

端侧智能常见问题

端侧大模型能在什么硬件上跑?
已适配 ARM Cortex-A/M、RISC-V、主流 NPU/DSP 与 x86 工控机,统一 Runtime 零代码切换,7B 模型 INT4 量化后可在 8GB 内存网关上运行,首 token <500ms。
量化会损失精度吗?
采用量化感知训练与 PTQ/QLoRA 混合策略,配合 KV Cache 压缩,模型体积降低 70%+,端侧推理精度损失 <1%,关键任务支持 FP16 回退。
离线环境下如何更新模型?
支持 OTA 增量热更新与灰度批次,断网期间模型与规则本地自治,网络恢复后自动同步样本与版本,失败自动回滚。
与云端大模型如何协同?
云端负责训练与全局调度,端侧负责实时推理;异常样本与微调增量回传云端持续迭代,形成边云闭环,数据不出园区也能进化。