ライブ文字起こし

録音ボタンを押すと、言葉がそのまま私たちのAIにストリーミングされます — テキストは声の数秒後に表示され、停止すると仕上がった文字起こしが届きます。

登録なし 透かしなし TXT · SRT · VTT エクスポート ファイルは24時間後に自動的に削除されます
ファイルをここにドラッグ&ドロップ
または ファイルを選択
無料: 1日 {0} ファイル · 各ファイル最大 {1} 分・{2} MB
0:00
ライブドラフト
言葉は、私たちのAIによってライブで転写され、話すときに現れます。終わったら「転写」を押すと、編集可能なバージョンが表示されます。
マイクアクセスがブロックされています。ブラウザのサイト設定で許可してください。または、代わりにファイルをアップロードしてください。

より大きなファイルや、より多くのアップロードが必要ですか? 無料アカウント:1日5ファイル、最長1時間のファイル · Pro: 最長10時間のファイル + 話者ラベル

0%
アップロード中...
このタブを開いたままにしてください — 文字起こしページに自動的に移動します。
Talks & speechesReal-time notesIn-room speechAccessibility

本当にライブ:話している間に音声が私たち自身のAIへ流れます

録音中、ページはマイクの音声を短いセグメントに切り分けます — 各数秒で、前のセグメントが返ってきた瞬間に次を送れるよう適応的にカットされます — そしてそれぞれをGPUサーバーへ直接送り、サイト全体を支えているのと同じWhisperクラスのモデルが即座に文字起こしします。テキストは声の数秒後にライブフィードに現れ、話し続ける限り流れ続けます。ブラウザの音声認識サービスも、サードパーティのディクテーションAPIも使いません — ライブのテキストは、私たち自身のハードウェアによる本物のWhisper出力です。

マイク録音さえできればよいので、ライブモードはあらゆる最新ブラウザで動作します — Chrome、Edge、Safari、Firefox、デスクトップでもスマホでも。各音声セグメントは、テキストが返ってきた瞬間にサーバーから削除されます。

ライブフィードと最終的な文字起こしの違い

セグメントごとの文字起こしには構造上の限界がひとつあります:モデルは一度に数秒分しか見ないため、2つのセグメントにまたがる単語は途切れることがあり、セグメント境界をまたぐ句読点は推測になります。そのため、フローの最後にもう一段階あります:話している間、完全な録音はブラウザ内に保持され、Transcribeを押すと全体をひとつのテイクとしてモデルにかけます — 完全な文脈、適切な句読点、タイムスタンプ、エディタ、そしてTXT/SRT/VTTエクスポートです。

ライブフィードは、追いつけているかの確認と、話したそばからテキストを拾うために使ってください(フィードにはコピーボタンがあります)。残しておくものには最終処理を使いましょう。すでにファイルとして持っている音声なら、各ツールページのアップロードモードが近道です。

よくある質問

これは本当にライブですか?それとも録音してから送信されるのですか?
本当にライブです:録音と文字起こしが並行して進みます。ページは数秒分ずつの音声スライスを、あなたが次のスライスを話している間にGPUへ送るので、テキストは録音の後ではなく録音中に積み上がります。フィードは声から数秒遅れます — スライスの録音完了、アップロード、文字起こしにかかる時間です。
なぜライブのテキストは私より数秒遅れるのですか?
3つの小さな遅延が積み重なってきます: スライスが録音されるまでの時間 (3秒程度) サーバに移動し、モデルを通過する。これは通常、フィードをあなたの声より 4-8秒遅らせます。GPUが一時的に忙しい場合、ページは遅れることなく、少し長いスライスを送信して適応します。自然な音声は休止を伴ってスムーズに感じます。
ライブモードはどのブラウザで動作しますか?
すべての最新のもの - Chrome, Edge, Safari, Firefox, デスクトップと携帯電話で。 ブラウザの音声サービスではなく標準のマイク録音に依存し、Chromeと同じようにFirefoxで動作します。
ライブ文字起こしの間、私の声はどこへ行くのですか?
私たちのサーバーだけです。正直に言えば:ライブモードでは、話している間、音声が短いセグメント単位で私たちに送られます — それがライブたるゆえんです — そして各セグメントはテキストが返ってきた直後に削除されます。Google、Apple、その他サードパーティの音声サービスには何も送られません。完全な録音はTranscribeを押すまでブラウザ内に残り、匿名の文字起こしは24時間以内に自動削除されます。
その場で会議や講義を追うのに使えますか?
個人的な補助としてなら使えます — デバイスを話し手の近くに置けば、フィードはクリアな話を約10秒遅れでよく追います。ただし限界も知っておいてください:マイクは1本なので、遠くの声や発言の重なりで精度が落ちますし、アクセシビリティ要件を満たす認定字幕サービスでもありません。最後にTranscribeを押せば、全体の文脈を使った処理で、ライブフィードが取りこぼした部分もたいてい復元されます。
ライブで使える言語は?言語は指定すべきですか?
このサイトのあらゆる文字起こしと同じ90以上の言語です — モデルが同じですから。ライブモードならではのコツをひとつ:自動検出のままにせず、セレクタで言語を選んでください。検出はセグメントごとに行われ、7秒では判断材料が足りないため、言語を固定すると短いフレーズやなまりのあるフレーズでフィードがぶれなくなります。