要約(3行)
- 小さな端末向けの AI を作る Cactus が、音声を文字にするモデル「Whistle」を公開した(ブログは 10/2 付)。ファイルは16.9MB 1つで、CPU で動き、依存するソフトは不要。英語・ドイツ語・フランス語・スペイン語・イタリア語・オランダ語・ポーランド語の7言語に対応し、1回に30秒までの音声を処理する。
- 会社の測定(Apple M4 Pro の CPU、10秒の音声)では、最初の文字が出るまで11.1ms。比較相手の Whisper base(145.3MB)は73.2ms、Moonshine tiny v2(41.9MB)は22.8ms。精度は、会社の表で LibriSpeech・SPGISpeech・Earnings-22・FLEURS の平均で Whistle が上、TED-LIUM・AMI・MLS の平均では Whisper base が上。
- モデルは Hugging Face で Apache 2.0、道具は
pip install cactus-needleで入る(PyPI のバージョンは 3.1.3、Apache-2.0)。単語ごとの時刻、特定の語句を認識しやすくする指定、音声の特徴ベクトルの取り出しも使える。
今後の使い方の流れ
- まず試す。 ブログの中にブラウザで動く試用の欄があり、マイクで話すと、その場で文字になる(最初にモデルを読み込む。音声は端末の外に出ない、とブログは書いている)。
- 手元の音声で動かす。
pip install cactus-needleのあと、16kHz の WAV 音声なら追加なしでneedle.transcribe("clip.wav")で文字が返る。ほかのサンプリング周波数やマイク入力は、追加の指定が要る。 - 言語と長さを確かめる。 対応の7言語に、日本語は入っていない。1回の処理は30秒まで。
- 自分の音声で比べる。 ブログの精度は会社の測定で、条件(機材・音声・設定)が自分の場面と同じとは限らない。同じ音声で他のモデルと並べて見る道具も用意されている(
needle whistle compare)。
この発表で何が変わりそうか(分析)
- 音声の文字起こしを、端末の中で終わらせやすくなる。 16.9MB のファイルが CPU で動くので、通信なしで、マイクの音声を外に出さずに文字にする設計がしやすくなる【推測】。ブラウザの中でも動く(ブログの試用欄)。
- 速さの主張は、「最初の文字まで」に寄っている。 11.1ms は音声を入れてから最初の文字が出るまでの時間で、処理全体の速さではない。ブログは別に、1秒あたり1,319トークン(Whisper base は266、Moonshine は262)の速さも示している。いずれも会社の測定。
- 精度は、項目で勝ち負けが分かれる。 会社自身が、TED-LIUM・AMI・MLS では Whisper base が上と書いている。16.9MB に対して145.3MB という大きさの差を、どう見るかになる。
- 日本語は対象外。 日本の利用では、今回のモデルを直接は使えない。同じ作りで言語を増やせるかは、書かれていない。
- 同じ道具で文字起こしと「命令の取り出し」をつなげる。 同社のモデル「Needle」と同じ実行ソフトで動き、音声から一度に道具の呼び出しまで出せると説明している。スマートホームの操作などを想定した例。
- 中の人の言葉:ブログは共同の署名だが、短く確かめられる引用の候補がなく、載せない。
出典
- Cactus「Whistle: Speech to Text in 16.9 MB」(2026-10-02)cactuscompute.com ↗
- Hugging Face「Cactus-Compute/whistle」huggingface.co ↗
- PyPI「cactus-needle」pypi.org ↗
確認メモ(2026-10-09 に確認):ブログの本文(概要・仕組み・ベンチマークの文・使い方)を開いて、言語・サイズ・速さ・比較の書き方を確かめた。ライセンスは Hugging Face のモデル情報のタグ(apache-2.0)と PyPI の表示で確かめた。比較の数字は会社自身の測定で、第三者の測定は確認できていない。Whisper と Moonshine の精度は、各開発元が公表した数字を会社が使ったと書かれている。実際にモデルを動かしてはいない。Hugging Face の公開日は 9/30(登録)、ブログは 10/2 付。



