メインコンテンツまでスキップ

Shisa ASR

Shisa ASR は、​日本語に​最適化され、​英語も​流暢に​扱える、​本番ワークロード向けの​音声認識​(音声テキスト変換)​API です。​単一の​ JSON リクエストで​音声を​高精度な​テキストに​変換し、​話されている​言語を​自動検出でき、​カスタム語彙に​よって​ドメイン固有の​用語の​認識を​強化できます。

POST https://api.shisa.ai/asr/srt/audio_llm

base64 エンコードされた​音声​(WAV、​OGG、​MP3、​または​ FLAC)を​送信すると、​文字起こし、​検出された​言語、​信頼度スコアが​返されます。​必須なのは​ audio フィールドのみで、​言語は​自動検出され、​チューニングパラメータには​適切な​デフォルト値が​使用されます。

Shisa ASR を​選ぶ理由

  • 日本語ファースト設計 — 地域的な​話し方を​含む日本語に​最適化され、​英語にも​対応します。
  • リアルタイムストリーミング — リアルタイムで​音声ストリームを​処理し、​ライブ文字起こしと​即座の​結果を​提供します。
  • 音声区​間検​出 — VADを​有効に​した​単一の​文字起こし、​または​タイムスタンプ付き音声セグメントを​返せます。
  • エンタープライズセキュリティ — データの​取り扱いに​ついては、​Shisa プラットフォームのプライバシーポリシーを​ご覧ください。
  • カスタム語彙hotwords を​介して​業界固有の​用語、​ブランド名、​カスタムフレーズを​追加し、​精度を​向上させます。

ユースケース

  • コールセンター分析 — 品質保証、​コンプライアンス、​エージェントトレーニング、​顧客センチメント分析の​ために、​カスタマーサービスの​通話を​自動的に​文字起こしします。
  • 会議メモ — 会議、​インタビュー、​ディスカッションを​検索可能で​実用的な​テキスト文書に​変換します。
  • 字幕と​キャプション — ビデオ、​ライブストリーム、​放送用の​正確な​字幕を​リアルタイムまたは​バッチモードで​生成します。

次の​ステップ

  • クイックスタート — curl、​Python、​または​ JavaScript で​最初の​文字起こしを​行います。
  • API リファレンス — リクエストパラメータ、​レスポンスフィールド、​エラー処理。
  • 音声と​言語 — サポートされている​形式と​言語選択の​動作。
  • 料​金 — ASR の​利用が​どのように​課金されるか。