Cactusは、モバイルデバイスの制約を前提に設計された推論エンジンです。レイテンシの低減、プライバシー保護、オフライン動作を重視しています。
既存フレームワークの問題点として、低中価格帯端末への対応不足や、バッテリー消費の多さを挙げています。Cactusはカーネルから独自に実装し、省エネルギー性とアクセラレータ対応を最適化しました。
性能面では、Qwen3-600m-INT8モデルのCPUベンチマークを示しています。Pixel 9やGalaxy S25、iPhone 16では50〜70トークン/秒を記録しました。NPU環境ではQwen3-4B-INT4が21トークン/秒で動作します。
開発者は、アプリ開発者が2〜5行のコードでエージェントワークフローを構築できるSDKを提供しています。すでにAnythingLLMやKinAIなどのアプリが本番環境で利用しており、週50万回以上の推論タスクを処理しています。
ライセンスは、趣味や個人プロジェクトには無料、商用利用には有料ライセンスが必要です。コードはGitHubで公開されています。
出典: Launch HN: Cactus (YC S25) – AI inference on smartphones(HN 123pt・63コメント)(HN Search (backfill)、2025-09-19)