結論から言うと、文字起こしの精度は良いマイクを買う前に、口とマイクの距離を詰める・Bluetooth接続をやめる・ノイズ除去とAGCを切るの3点で動きます。どれも各社の公式ドキュメントに条件として書かれていて、費用は0円です。買い替えを考えるのはこの3つを試したあとで間に合います。
「認識率98.86%」は、条件が付いた数字として書かれている
Nottaの料金ページのFAQには、精度についてこう書かれています。
フォーマルな会議など、整然とした発言が行われる場合には、認識率は98.86%以上となります。※収音が困難な場合は、認識精度に影響を与える可能性があります。
読み飛ばしやすいのは後半です。この数字の前提は「整然とした発言」であり、さらに収音が困難なら精度に影響すると公式が自分で但し書きを付けています。裏を返すと、利用者側で動かせる余地は認識エンジンではなく収音のほうにある、ということになります。
同じ順序は他社の開発者向けドキュメントにも出てきます。Microsoft Learn のカスタム音声のページは「音声サンプルを集める前に、マイクと信号処理のハードウェアの見直しを常に検討する」と書いています。認識側より先に入り口を見よ、という順番で揃っています。
公式に書かれている録音条件を、出典ごとに並べる
数字と文言が確認できたものだけを表にしました。
| 見る項目 | 公式に書かれている条件 | 書いてある場所 | かかる費用 |
|---|---|---|---|
| 口とマイクの距離 | 「話者とマイクの距離を20cm〜60cm程度にするのが理想的」 | Notta 公式 | 0円 |
| Bluetooth接続 | 「一部のBluetoothイヤホンは、8kHzの低いサンプリングレートしか対応していない」 | Notta 公式 | 0円(有線に替える) |
| サンプリングレート | 「Capture audio with a sampling rate of 16,000 Hz or higher.」「However, avoid re-sampling.」 | Google Cloud Speech-to-Text | 0円(録音設定) |
| 保存する形式 | 「Use a lossless codec to record and transmit audio. FLAC or LINEAR16 is recommended.」 | Google Cloud Speech-to-Text | 0円(録音設定) |
| 自動調整の処理 | 「Do not use automatic gain control (AGC).」「All noise reduction processing should be disabled.」 | Google Cloud Speech-to-Text | 0円(設定) |
| 同時に話すこと | 「2人以上で同時に発言を控えるようにしましょう」 | Notta 公式 | 0円 |
| 前後の無音 | 「include at least a half-second of silence before and after speech in each sample file」 | Microsoft Learn | 0円 |
注意点をひとつ。GoogleとMicrosoftの文言はそれぞれ自社のサービスに向けた指針で、Nottaの内部エンジンにそのまま当てはまると公式に書かれているわけではありません。ただし「距離」「16kHz」「加工しすぎない」という方向は各社で食い違っていないので、共通する部分だけを採りました。
見るべきは3つ
1. 口とマイクの距離を詰められる経路か
いちばん効くのに、いちばん軽視されるのがここです。Nottaの精度向上ページは、内蔵マイクについて「口元から離れている場合、音量が十分ではなく、クリアな音声を収集できない」、外部マイクについても「離れた場所からボソボソとした声で話すと上手く収音できない可能性」と書いています。距離の目安として挙がっているのが先の20cm〜60cmです。
複数人が同じ部屋にいるなら、内蔵マイクで録る場合は「マイクをできるだけ中央に配置」、スピーカーフォンは「遠くに座る人の声まで明瞭に収集」できる点が挙げられています。インタビューの項では「出来るだけマイクに近づけて話しましょう」としつつ、近づけすぎには「ポップノイズを防ぐために適切な距離を保ちます」とも書かれています。近いほど良いのではなく、20〜60cmの帯に入れるという話です。
マイクの方式ごとの向き不向きはWeb会議マイクのおすすめは?聞き取りやすさは値段より距離で決まるにまとめてあるので、機材から入りたい場合はそちらが早いです。
2. 経路のどこかで音を細くしていないか
ここが「録音した瞬間にしか直せない」層です。Google Cloud のドキュメントは16,000Hz以上での収録を求めたうえで、「However, avoid re-sampling.」(ただし再サンプリングは避ける)と続けます。電話音声のように元が8,000Hzなら「that is the rate that should be sent to the service」(その値のまま送るべき)とも書かれています。つまり細い音を後から太く変換して戻るとは書かれていないわけです。
そこに効いてくるのがBluetoothです。Nottaの精度向上ページには「一部のBluetoothイヤホンは、8kHzの低いサンプリングレートしか対応していない」という記述があり、16kHzのWide Band Speech対応が推奨として挙がっています。手元のイヤホンがどちらかは機種によりますが、判断が付かないなら会議の日だけ有線に替えるのが確実で、費用もかかりません。
形式も同じ層の話です。Googleは可逆コーデック(FLAC / LINEAR16)を推奨し、mp3などの非可逆の形式は精度を下げうるとしています。一方でNottaの精度向上ページに挙がっているのは「WAV、MP3ファイル」で、「はっきりとした声で音質がクリアな場合は、ほぼ正しく認識」と書かれています。mp3が使えないという意味ではありません。録り直しがきかない音源なら、形式より先に距離と静かさを優先するほうが現実的です。
3. 精度のために加工を足していないか
直感に反する部分です。Google Cloud のベストプラクティスには「Avoid audio clipping. Do not use automatic gain control (AGC).」(音の割れを避ける。自動ゲイン調整は使わない)「All noise reduction processing should be disabled.」(ノイズ低減処理はすべて無効にする)と書かれています。認識器の側は「designed to ignore background voices and noise without additional noise-canceling」(追加のノイズキャンセルなしで背景の声や雑音を無視するよう設計されている)とされているため、手前で削る処理はむしろ邪魔になりうる、という立て付けです。
同時発話についても「複数人が同時に、あるいは異なる音量で話すと、背景雑音とみなされて無視されることがある」とあります。Notta側の「2人以上で同時に発言を控えるようにしましょう」と同じ指摘です。
ただし会議アプリのノイズ抑制を切ると相手側には雑音がそのまま届きます。Zoom・Teams・Google Meet それぞれの設定が公式にどう説明されているかは先のWeb会議マイクの記事に引用してあるので、切る前に読むほうが安全です。
会議が始まる前の、2分の手順
- イヤホンを有線に替える(機種が16kHz対応と分かっているならそのままで構いません)
- マイクを20〜60cmの帯に置く。内蔵マイクなら本体を手前に、複数人なら卓上の中央に
- 自分の側が静かな部屋なら、ノイズ抑制とAGCを切る。騒がしい場所なら切らない
- 録音を始めて0.5秒ほど置いてから話し出す。終わりも、話し終えてから止める
- 社名・製品名・人名は事前に単語登録しておく。Nottaの単語登録機能は日本語のみと公式に書かれています
録るところから議事録までの流れは会議のメモが取れない・聞き逃す人へ|記録を任せる3つの受け皿に、Zoomの録画を文字にする手順はZoom録画の文字起こしを無料でやる方法|公式機能と外部ツールの境目に書いています。
正直な短所
- Nottaの無料プランは枠が小さい。 公式の料金ページによると、フリーは文字起こし時間が120分/月、1回につき3分まで、ファイルインポートが50個/月、AI要約が10回/月です。長い会議をその場で録るなら「1回3分」のほうが先に当たります。内訳はNottaの無料プランはどこまで使える?月120分と1回3分の内訳にまとめました
- 公式自身が精度を保証していない。 98.86%には「収音が困難な場合は、認識精度に影響を与える可能性があります」という但し書きが付いています。条件を整えても、話し方や専門用語の量で結果は変わります
- 可逆形式は容量が増える。 WAVで長時間の会議を録るとファイルが大きくなり、回線の細い環境ではアップロードが壁になります
- ノイズ抑制を切ると相手が困ることがある。 精度のための設定と、会議の聞きやすさのための設定は一致しません
- GoogleとMicrosoftの指針は自社エンジン向けです。 他社に同じ数字が当てはまると公式に書かれているわけではないため、そこは断定できません
よくある質問
Q. 無料プランと有料プランで、文字起こしの精度は変わりますか?
Nottaの料金ページのプラン比較表で差として書かれているのは、文字起こし時間(120分/月・1,800分/月・無制限)、連続録音時間(3分・5時間)、ファイルインポート回数、AI要約回数といった枠の部分です。プランによって認識精度が変わるという記載は、料金ページからは確認できませんでした。
Q. Bluetoothイヤホンを使うと精度が落ちますか?
公式に書かれているのは「一部のBluetoothイヤホンは、8kHzの低いサンプリングレートしか対応していない」という条件付きの記述で、全機種がそうだとは書かれていません。16kHzのWide Band Speech対応が推奨として挙がっているので、手持ちの仕様を確認するか、確認できないなら録音の日だけ有線にするのが手堅い対応です。
Q. すでに録ってしまった音声を、後から加工すれば精度は上がりますか?
Google Cloud のドキュメントには「avoid re-sampling」(再サンプリングは避ける)とあり、低いレートで録れたものを変換して送ることは推奨されていません。録り直せない音源は、音そのものより固有名詞の単語登録など、テキスト側で拾いにいくほうが現実的です。無料で試せる選択肢はAI文字起こし無料比較|定番が終了した今、無料で残っているのは4つに整理してあります。
まとめ
- 精度を動かす余地は認識エンジンより収音側にあり、公式が挙げている条件は距離・経路・加工の3つに整理できます
- 費用のかかる対策より先に、20〜60cmに寄せる/有線に替える/ノイズ抑制とAGCを切るを試すと、何が効いたのか分かります
- ただし公式自身が「収音が困難な場合は精度に影響する可能性」と書いており、条件を整えても結果が一定になるとは書かれていません