Cactus:移动端低延迟 AI 推理引擎
介绍 Cactus 的端侧推理、内存映射与边缘云混合路由,说明支持硬件、模型格式、后台限制和数据外传条件。
直接回答:Cactus 是面向移动与边缘设备的推理项目。当前 Hybrid 能力主要指基于本地模型信号把部分请求路由到云端,不是 NPU/GPU/CPU 算子调度器;支持硬件需按版本核对。
端侧设备的内存难题
移动系统有进程内存与后台执行限制,但不是任何数百 MB 模型都会被杀。峰值驻留内存、应用前后台状态、系统压力与平台策略都会影响运行。需要在目标设备测试,而不是只比较模型文件大小。
零拷贝内存映射
内存映射可减少某些复制与加载开销,但访问权重页仍会使用物理 RAM;还需计算激活、缓存与运行时开销。它不能保证内存恒定、降低十倍或后台进程永不被清理。
模型格式和转换工具应按当前项目支持的架构与版本核对,不意味着任意 GGUF 可直接转换。
NPU 优先架构
官方当前仓库展示 CPU/GPU kernels 与相关设备支持。NPU 支持需要具体芯片、操作系统、算子和发布版本证据,不能概括为苹果、高通、联发科全部“吃满”。
Hybrid Router 与测量方法
Hybrid 将边缘推理与云服务结合,可能根据本地模型置信信号选择云端。该信号不是质量保证,且云路由会改变隐私、离线和计费属性。
本文未做实时转写或功耗测试。测量时应固定模型、音频、硬件与后台状态,记录首包、完整耗时、能耗和驻留内存。
适合谁
- 做端侧 AI 功能(离线转写、本地助手、隐私敏感推理)的移动开发者
- 被"模型一加载 App 就被杀"折磨过的人
- 需要跨端 SDK(iOS/Android/RN/Flutter)统一推理层的团队
常见问题(FAQ)
Q:任意模型都可转换吗?
A:先确认架构、算子和格式支持。
Q:没有 NPU 能运行吗?
A:看具体 CPU/GPU 内核与设备支持;Hybrid 不是硬件回退保证。
Q:相对其他引擎一定省十倍内存吗?
A:没有可通用的结论,需同条件比较。
参考资料
资料核对日期:2026 年 9 月 29 日。本文基于公开文档整理,代码片段和评估方案未作独立运行或性能验证;厂商测试结果已注明来源。