結論から言うと、Nottaで話者が分かれないときはまず「未指定話者」と表示されていないかを見てください。そう出ていれば話者識別はオフで、精度ではなく設定の問題です。オンなのに人数が合わない場合だけが精度の話で、その対策は録音経路を変えることになります。
最初に見るのは精度ではなく、話者名の表記
公式ヘルプ「話者識別機能はついていますか?」には、切り分けの方法がそのまま書かれています。
話者識別をオフにしている場合、すべて話者は「未指定話者」と表示されます。話者識別をオンにしている場合、話者は「話者1」「話者2」のような「話者+番号」の形式で表示されます。
文字起こし結果を開いた時点で、どちらの問題かが判別できます。
- 「未指定話者」しかない → 機能がオフのまま変換された。設定の問題
- 「話者1」「話者2」と出ているが人数が合わない → 機能は働いている。収音と経路の問題
前者は録り直しではなく「再文字起こし」で直せます。後者は同じ音源をかけ直しても結果はあまり変わらないので、次の録音の条件を変えるほうが早い。公式も、識別精度が気になる場合はフィードバックを送るよう案内しています。
話者識別の条件は、入力経路ごとに違う
Nottaの話者識別は「プランに付いているかどうか」ではなく、どの経路で音を入れたかで条件が変わります。公式ヘルプの表を経路別に整理すると次のようになります。
| 入力経路 | オンにする操作 | 話者識別できる発話言語 | 識別できる人数 | つまずきやすい点 |
|---|---|---|---|---|
| 画面収録 | 収録を始める前にオンにする | すべての発話言語 | 最大10名 | オンにし忘れたまま収録が終わりやすい |
| Chrome拡張機能によるタブ録音 | 不要(デフォルトで識別) | 日本語の場合のみ | 公式に人数の記載なし | 英語の会議では条件から外れる |
| マイク録音のリアルタイム文字起こし | 不要(デフォルトで識別) | 日本語の場合のみ | 最大10名 | 同上 |
| ファイルアップロード | アップロード時にオンにする | すべての発話言語 | 最大10名 | 話者識別ありは最大3時間の制限がかかる |
| Notta BotによるWeb会議 | ― | すべての発話言語 | 上限なし | 参加アカウント単位での識別になる |
Nottaの音声認識そのものは公式ヘルプに「日本語・英語など58言語に対応」とありますが、話者識別まで含めて全言語で通るのはファイルアップロード・画面収録・Notta Botの3経路です。残る2経路は原文で「発話言語が日本語の場合のみ話者識別が可能です」と限定されています。英語の商談を拡張機能で録って話者が分かれないのは、不具合ではなく仕様の範囲です。
逆に、この2経路は手動でオンにしなくてもデフォルトで識別されるとも書かれています。設定を探す必要があるのは画面収録とファイルアップロードのほうで、オンにし忘れが起きるのもこの2つです。
Notta のファイルアップロードには、もうひとつ見落としやすい上限があります。ヘルプ「ローカルファイルのインポート」は音声1GBまたは5時間、動画10GBまたは5時間と書いたうえで、続けて「話者を識別する場合の最大サイズは3時間のいずれか小さい方」としています(原文の文はやや崩れていますが、話者識別を使う場合の上限として3時間が示されています)。5時間録れるつもりで4時間のセミナー音源を上げると、ここで条件から外れます。
判断軸は3つ
1. その会議の言語は日本語か
日本語なら上の5経路すべてが候補です。英語や中国語が混じるなら、ファイルアップロード・画面収録・Notta Botの3つに絞られます。ICレコーダーやZoomのローカル録画をあとから上げる流れが確実で、機材から見直すなら会議録音のICレコーダーおすすめ|文字起こし前提なら見る仕様は3つに選定の基準をまとめています。
2. 参加者が何台のマイクから話すか
Notta Botだけは識別人数に上限がありませんが、代わりに条件が付きます。原文はこうです。
会議の参加者アカウントに基づいて識別が行われるため、各発言者が独立したアカウントから参加していることをご確認ください。複数の参加者が共有アカウントから発言した場合、それらの発言はすべて共有アカウントにまとめられます。
会議室に集まった3人が1台のPCから参加していると、3人ぶんの発言が1つのアカウントにまとまります。人数無制限という表記に期待して会議室から参加すると、ここで外れます。この形なら、その場をマイク録音するか録音ファイルを上げる経路のほうが話者は分かれます。
音が重なる場合の扱いも公式に書かれていて、「複数の人が同時に発言した場合は、音同士が被って収録されてしまい、誤認識となります」とあります。認識率の目安も、フォーマルな会議で90%以上、軽い打合せで50〜80%程度と幅のある書き方です。録音側の条件は文字起こしの精度を上げる録音のコツ|公式の根拠がある3つだけに出典ごとに整理してあります。
なお、デスクトップ版の「ボットなし録音」はこの問題への公式の答えのひとつです。マイク入力とシステムオーディオを2つの独立したチャンネルとしてキャプチャし、「これら2つのチャンネルは個別に処理されるため、最終的な文字起こし結果における話者識別(誰が話しているか)の精度が向上します」と説明されています。自分の声と相手の声を機械的に分けられるので、オンライン会議で自分と相手さえ分かれればよいならこれが最短です。前提条件は「すべてのプランで利用可能」です。
3. やり直しの消費量を払えるか
オンにし忘れた場合の救済が「再文字起こし」です。ヘルプの冒頭に「文字起こし言語の選択誤りや、話者識別の選択忘れ等の場合は」とあり、まさにこの用途で案内されています。ただし消費が伴います。
再文字起こしを行うたびに、音声の長さと同じ分数の文字起こし時間が消費されます。また、あわせてファイルアップロード枠も1回分消費されます。
60分の会議を1回やり直せば合計120分を使う計算です。フリープランの月間文字起こし時間は120分なので、1回のやり直しで月の枠を使い切ります。枠の全体像はNotta無料プランの制限はどこまで?月120分より先に「1回3分」で詰まるにまとめています。
再文字起こしには対象外もあります。「Notta BotによるWeb会議の文字起こしおよびYouTube動画の文字起こしの再文字起こしは対応しておりません」と明記されているため、Bot経由の会議は後追いのやり直しができません。Botで録るなら一発勝負です。
正直な短所
オンにし忘れを防ぐ設定は、上位プランの機能です。 ワークスペース単位でファイル文字起こしの話者識別をデフォルト有効にする設定は、前提条件に「プラン:ビジネスプランとエンタープライズプランで利用可能」「ロール:オーナーとアドミンのみ設定可能」と書かれています。個人プランでは毎回自分でチェックを入れる運用が続きます。
録音中は話者名を編集できません。 「録音中・文字起こし中のデータでは、話者の変更・編集・削除ができません」と明記されています。名前付けは変換が終わってからの作業になります。
プランを上げる順番を間違えると、付けた話者情報が消えることがあります。 上限を超えた音声をアップグレード後にアンロックすると「再度の文字起こし処理が実行され」、「話者情報を含む元の文字起こしテキストは、新しい処理結果によって上書きされ、消えてしまうことがあります」と公式ヘルプにあります。先にプランを決めてから取り込む順序が安全です。
話者識別はプランで差が付く機能ではありません。 料金ページのフリープラン欄には「フリー機能:ミーティングの文字起こし/話者識別」と文言で書かれ、ヘルプのプラン別機能一覧でもフリープランの機能として挙がっています。有料にしても識別の条件そのものは変わりません。変わるのは時間とファイル数の枠のほうです。
よくある質問
無料プランでも話者識別は使えますか? 公式料金ページのフリープラン欄に「話者識別」が文言として記載され、ヘルプのプラン別機能一覧でもフリープランの機能として挙がっています。ただし文字起こし時間が月120分、1回につき3分までという上限は別にかかります。
話者の名前は後から変えられますか? ヘルプ「話者を管理する」の前提条件は「プラン:すべてのプランで利用できます」で、権限は「編集可能」以上とされています。Web版では「会話分析」から各話者の発言時間の割合や発話回数も確認できます。
専門用語の誤変換も話者識別の設定で直りますか? 別の問題です。用語の精度は単語登録の側で、登録できる数はプランごとに上限があります。詳しくはNottaの精度は専門用語で落ちる?単語登録は無料3個・日本語のみにまとめています。
まとめ
- 「未指定話者」と出ていれば設定の問題、「話者1」「話者2」と出ていれば収音と経路の問題。まず表記を見る
- Chrome拡張のタブ録音とマイク録音のリアルタイム文字起こしは、公式に「発話言語が日本語の場合のみ」と限定されている。英語の会議はファイルアップロードか画面収録かNotta Botへ
- やり直しは音声の長さぶんの文字起こし時間とファイル枠を消費し、Bot経由の会議は再文字起こしの対象外。録る前にオンにしておくのが唯一のコスト削減