メインコンテンツへスキップ
VoiceSDK は、自動チャットシステム統合と音声対応アプリケーション構築のための React フックを備えた、高度な音声会話機能を提供します。AI エージェントとの自然な音声インタラクションを、オーディオ可視化、文字起こし、会話管理とともに作成できます。この記事では、すぐに使い始められるだけでなく、動作の仕組みも理解できるクイックスタートの例を紹介します。記事の残りの部分では、使用できる various メソッド、その用途、ベストプラクティスについて詳しく説明します。

インストール

クイックスタート

基本的な音声会話

この例では、TypeScript と React の両方のアプリケーションで VoiceSDK を使用してリアルタイム音声会話を作成する方法を学びます。まず、会話を処理する AI 音声エージェントを定義する特定の agentId を含む API 資格情報で VoiceSDK を初期化します。次に、startVoiceConversation() を使用して、接続イベントへの応答、AI メッセージの受信、切断の処理、ユーザーが話している内容のリアルタイム文字起こし(isFinal が完全なフレーズの認識完了を示す)に対応するコールバックハンドラ付きの音声セッションを開始します。saveToChat オプションにより、音声会話をテキストとしてチャット履歴に保存し、後で参照できます。React アプリケーションでは、useVoiceConversation フックを使用します。これは組み込みのステート管理を備えたよりクリーンなインターフェースを提供します。接続状態を追跡する status 変数、会話を制御する startSession()endSession() メソッド、音声レベルを調整する setVolume()、音声入力の可視化に使用する getInputByteFrequencyData()(波形表示の作成に最適)、現在の音量レベルなどのリアルタイム情報を含む conversationState が提供されます。これにより、リアルタイムの音声認識と合成を備えた音声対応 AI アプリケーションの構築に必要なすべてが揃います。ボイスアシスタント、ハンズフリーインターフェース、対話型 AI エクスペリエンスの作成に最適です。React フックが複雑なステート管理と WebSocket 接続をすべて処理してくれます。

React フックの使用方法

設定

VoiceSDKConfig インターフェース

VoiceSettings

設定例:

コア機能

音声会話セッション

VoiceSDK は自動チャット統合を備えた音声会話セッションを管理します:

音声メッセージ

セッション管理

startVoiceConversation(options?)

新しい音声会話セッションを開始します。
StartVoiceConversationOptions:
例:

endVoiceSession(sessionId, reason?)

音声会話セッションを終了します。
例:

getVoiceState(sessionId)

現在の音声会話の状態を取得します。
例:

React 統合

useVoiceConversation フック

useVoiceConversation フックは、ステート管理を備えた React 統合を提供します:
完全な React の例:

音声コントロール

音量コントロール

マイクコントロール

音声設定の更新

オーディオ可視化

リアルタイムオーディオデータ

オーディオ可視化コンポーネント

チャット統合

自動チャット保存

音声会話はチャットシステムに自動保存できます:

手動チャット統合

コンテキスト更新

音声会話に追加のコンテキストを送信します:

エラーハンドリング

音声対応カスタマーサポート

ベストプラクティス

エラーハンドリングとフォールバック

リソース管理

パフォーマンスの最適化

アクセシビリティ