Cactus:移动端低延迟 AI 推理引擎

介绍 Cactus 的端侧推理、内存映射与边缘云混合路由,说明支持硬件、模型格式、后台限制和数据外传条件。

最佳实践
智能体工具协作与任务执行插画

直接回答:Cactus 是面向移动与边缘设备的推理项目。当前 Hybrid 能力主要指基于本地模型信号把部分请求路由到云端,不是 NPU/GPU/CPU 算子调度器;支持硬件需按版本核对。

端侧设备的内存难题

移动系统有进程内存与后台执行限制,但不是任何数百 MB 模型都会被杀。峰值驻留内存、应用前后台状态、系统压力与平台策略都会影响运行。需要在目标设备测试,而不是只比较模型文件大小。

零拷贝内存映射

内存映射可减少某些复制与加载开销,但访问权重页仍会使用物理 RAM;还需计算激活、缓存与运行时开销。它不能保证内存恒定、降低十倍或后台进程永不被清理。

模型格式和转换工具应按当前项目支持的架构与版本核对,不意味着任意 GGUF 可直接转换。

NPU 优先架构

官方当前仓库展示 CPU/GPU kernels 与相关设备支持。NPU 支持需要具体芯片、操作系统、算子和发布版本证据,不能概括为苹果、高通、联发科全部“吃满”。

Hybrid Router 与测量方法

Hybrid 将边缘推理与云服务结合,可能根据本地模型置信信号选择云端。该信号不是质量保证,且云路由会改变隐私、离线和计费属性。

本文未做实时转写或功耗测试。测量时应固定模型、音频、硬件与后台状态,记录首包、完整耗时、能耗和驻留内存。

适合谁

  • 做端侧 AI 功能(离线转写、本地助手、隐私敏感推理)的移动开发者
  • 被"模型一加载 App 就被杀"折磨过的人
  • 需要跨端 SDK(iOS/Android/RN/Flutter)统一推理层的团队

常见问题(FAQ)

Q:任意模型都可转换吗?
A:先确认架构、算子和格式支持。

Q:没有 NPU 能运行吗?
A:看具体 CPU/GPU 内核与设备支持;Hybrid 不是硬件回退保证。

Q:相对其他引擎一定省十倍内存吗?
A:没有可通用的结论,需同条件比较。

参考资料

资料核对日期:2026 年 9 月 29 日。本文基于公开文档整理,代码片段和评估方案未作独立运行或性能验证;厂商测试结果已注明来源。

延伸阅读

获取专属方案

联系我们

加入社区

微信扫码
加入官方交流群

立即体验

在线开通,按量计费,真正的云服务!

立即开始

选择观测云版本

代码托管平台