音声から字幕へ変換
音声認識機能を統合し、動画内の音声内容を自動で識別してタイムコード付きの字幕タイムラインを生成し、手作業の文字起こしを減らします。
场辞は、音声認識技術をベースにした動画字幕制作ソフトで、動画や音声内の発話をすばやく字幕に変換し、その後の校正、スタイル調整、書き出し焼き込みまで対応します。ページ情報によると、高頻度で字幕を制作するコンテンツワークフローを対象としており、認識から完成版までの一連の流れを重視しています。
公式サイトでは、场辞は一般的な動画、音声、字幕ファイルのインポートに対応し、複数トラック字幕編集、視覚的なタイムライン、リアルタイムプレビュー、ワンクリック書き出しなどの機能を提供すると案内されています。ドキュメントページにはショートカット、トラックのスタイル設定、書き出し形式、よくある質問も記載されており、単なる音声転写サービスではなく、字幕制作に特化した編集ツールであることが示されています。
音声認識機能を統合し、動画内の音声内容を自動で識別してタイムコード付きの字幕タイムラインを生成し、手作業の文字起こしを減らします。
複数の一般的な音声・動画・字幕ファイルの取り込みに対応しており、既存素材をそのまま字幕制作フローに組み込めます。
複数トラックの並行編集、可視化されたタイムライン編集、字幕一覧、テキスト編集を提供し、1件ずつの校正やタイミング調整に適しています。
字幕効果をリアルタイムでプレビューでき、編集時には字幕をドラッグ、拡大縮小、回転できるため、画面上の見え方を直接確認できます。
SRT、ASS、TXT、標準 MP4 の書き出しに対応し、字幕付き動画のワンクリック焼き込みとパラメータ設定も可能です。
ショートカット、検索置換、新規作成/保存などの操作を備え、高頻度の字幕制作でも効率を保てます。
インタビュー、講義、解説、その他の長尺動画をすばやく字幕化したい個人クリエイターや制作担当者に適しており、自動認識後に校正と微調整を行えます。
ポストプロダクションのあるチームが、まず SRT を書き出し、その後 PR などの後期工程で字幕と動画の合成を進めるのに適しています。
オンライン教育、短尺講座、録画授業の制作に適しており、講師の発話を自動認識した後にすばやく字幕を生成し、聞き取りの繰り返し作業を減らせます。
ショート動画、Vlog、番組の編集後工程に適しており、字幕をすばやく作成したあと、そのまま字幕付き動画を焼き込み、必要に応じてパラメータを設定できます。
字幕テキスト、スタイル、タイムコードを何度も修正する編集シーンに適しており、複数トラック、検索置換、ショートカットで校正効率を高められます。
场辞は、一般的な動画、音声、字幕ファイルの取り込みに対応し、標準 MP4 と SRT、ASS、TXT ファイルを出力できます。
ヘルプ文書によると、ツールバーから字幕ブロックを作成するか、再生中に JK キーを使って開始・終了時間と次の字幕ブロックの起点を指定できます。
タイムライン左側で現在のトラックのフォント、文字サイズ、文字間隔、縁取り、拡大縮小、配置を設定でき、スタイルの効果をリアルタイムでプレビューできます。
文書では、認識中に現在のウィンドウを閉じないよう案内されています。閉じると認識結果が失われる可能性があります。認識失敗が発生した場合は、まずネットワークが切断されていないか確認し、ネットワーク以外の原因であればサポートに連絡してください。
標準 MP4 の書き出し時、文書では動画は H.264 コーデック、音声は AAC コーデックを使用すると説明されています。CRF は固定品質モード、ABR は平均ビットレートモードです。