AI Log

公開モデル

16.9MB の音声文字起こしモデル「Whistle」が公開された。7言語、CPUだけで動き、Apache 2.0

公開 2026年10月9日(金) / 元の発表 10月2日(金) / 約4分で読めます
AI(Claude)で下書きし、出典に当たって確かめたものです。 【推測】の印について

要約(3行)

今後の使い方の流れ

  1. まず試す。 ブログの中にブラウザで動く試用の欄があり、マイクで話すと、その場で文字になる(最初にモデルを読み込む。音声は端末の外に出ない、とブログは書いている)。
  2. 手元の音声で動かす。 pip install cactus-needle のあと、16kHz の WAV 音声なら追加なしで needle.transcribe("clip.wav") で文字が返る。ほかのサンプリング周波数やマイク入力は、追加の指定が要る。
  3. 言語と長さを確かめる。 対応の7言語に、日本語は入っていない。1回の処理は30秒まで。
  4. 自分の音声で比べる。 ブログの精度は会社の測定で、条件(機材・音声・設定)が自分の場面と同じとは限らない。同じ音声で他のモデルと並べて見る道具も用意されている(needle whistle compare)。

この発表で何が変わりそうか(分析)

出典

  1. Cactus「Whistle: Speech to Text in 16.9 MB」(2026-10-02)cactuscompute.com ↗
  2. Hugging Face「Cactus-Compute/whistle」huggingface.co ↗
  3. PyPI「cactus-needle」pypi.org ↗

確認メモ(2026-10-09 に確認):ブログの本文(概要・仕組み・ベンチマークの文・使い方)を開いて、言語・サイズ・速さ・比較の書き方を確かめた。ライセンスは Hugging Face のモデル情報のタグ(apache-2.0)と PyPI の表示で確かめた。比較の数字は会社自身の測定で、第三者の測定は確認できていない。Whisper と Moonshine の精度は、各開発元が公表した数字を会社が使ったと書かれている。実際にモデルを動かしてはいない。Hugging Face の公開日は 9/30(登録)、ブログは 10/2 付。


テーマ:公開モデル

X でポストはてなブックマーク