音声エージェント

リアルタイム音声エージェント。レイテンシの制約が厳しく、割り込み処理とターンテイキングの質が実用性を左右します。

3件

Pipecat音声エージェント

音声から音声までのループ——文字起こし、モデル、音声合成、割り込み処理——を、差し替え可能なサービスのパイプラインとして組み立てます。正しく作ろうとすると面倒になるのがまさにこの部分です。音声用途ではレイテンシがすべてであり、ターンテイキングと割り込み(バージイン)を後付けではなく一級の要素として扱っています。実運用ではモデル選定以上に、トランスポートとネットワーク構成への配慮が必要になります。

公式BSD-2-Clause14.9k+512
LiveKit Agents音声エージェント

LiveKitルームへプログラム可能な参加者として接続するサーバー側エージェントを構築し、WebRTC通信、ジョブ配信、電話連携、ターン検出、各種モデルプロバイダー連携をまとめて扱います。メディア通信と本番セッションの運用を一つの基盤で組みたい用途に向きます。一方、テキスト専用のエージェントや通信層に依存しないパイプラインには、LiveKit前提の構成が過剰になる場合があります。

公式Apache-2.013.3k+180
TEN Framework音声エージェント

音声エージェントのうち、モデルの外側にあって通常は手作業で組み上げる部分を覆います。発話の検出、ターン終了の判定、話者の分離、電話網への接続、口の動きを同期させたアバターの駆動、さらには組み込み機器への到達までが対象です。ただし採用の前にライセンスを読んでください。Apache 2.0にAgoraによる追加条件が付いており、モバイル端末を含むエンドユーザー機器上でのホスティングと、Agora自身の提供物と競合する形での配備が禁じられています。

公式ソース公開型11.1k+22