2026年10月06日
【2026年最新】ジッター(ジッタ)とレイテンシー(レイテンシ)の違い|原因・許容値・測定方法と改善策
※2026年時点での通信規格(Wi-Fi 7, 5G/6G, リアルタイム音声AI通信)およびWebRTCの通信品質基準に基づき情報を更新しました。 ※この投稿は、Agoraの日本総代理店であるブイキューブが、Agoraブログを翻訳した記事です。 ※一部、日本向けに調整しています。 リアルタイム通信の品質を左右するのは“回線の太さ(帯域)”だけではありません。会議や通話、ライブ配信、オンラインゲームを快適にする鍵は、ジッター(ジッタ)とレイテンシー(レイテンシ)です。 ジッターは到着時間の“ばらつき”、レイテンシーは“応答までの遅れ”。似て非なる指標で、どちらが崩れても音切れ・映像カクつき・操作遅延が発生します。 本記事では、ジッターとレイテンシーの違いをわかりやすく整理し、主な原因、用途別の許容値の目安、実務で使える測定方法、そして今すぐできる改善策までを体系的に解説します。Web会議・VoIP・配信・RTE(Real-Time Engagement)の品質改善にそのまま役立つ実践ガイドです。
続きを読む
2026年10月02日
レイテンシー(レイテンシ)とは? 原因・測定と遅延の短縮方法
レイテンシーは、しばしばインターネットの「速度」として語られる帯域幅と混同されがちです。多くのインターネットサービスプロバイダーは「○○Mbpsで速い」「競合より30%速い」と帯域幅を強調しますが、体感の速さや操作の反応の速さは帯域幅だけでは決まりません。 正しくは、帯域幅=一度に流せる量(道路の幅)、レイテンシ=最初のデータが届くまでの時間(目的地までの時間)という別の指標です。道路がどれだけ広くても、目的地までの時間が長ければ到着は遅いのと同じで、レイテンシは実効的な速さ(ページの表示開始やクリック後の応答)を支える一方で、しばしば上限を決めるボトルネックになります。 本記事では、レイテンシーの意味、帯域幅との違い、主な原因、かんたんな測定方法、そして改善のコツをわかりやすく解説します。
続きを読む
2026年09月18日
WebRTC SDK比較|Agora・Twilio・Amazon Chime SDK等7サービスを徹底比較【2026年版】
オンライン会議やライブ配信、ビデオ通話は、いまやビジネスにも個人の生活にも欠かせないものになりました。こうしたリアルタイムのコミュニケーションをWebブラウザ上で実現する技術がWebRTCです。2021年にはW3CとIETFによって標準化され、ブラウザ間の互換性や安定性も向上しています。 とはいえ、WebRTCはあくまで「技術規格」です。サーバーの構築や大規模配信への対応、録画、AI連携などは、実際には自前で用意する必要があります。そこで多くの企業が選ぶのが、こうした機能をまとめて提供してくれる商用SDKです。サーバー運用の手間がかからず、SFU(Selective Forwarding Unit)を使った多人数接続や録画・配信機能も標準で使えるようになります。 ただし、商用SDKにも複数の選択肢があり、どれを選べばいいか迷う方も多いのではないでしょうか。本記事では、主要7サービスの料金・同時接続数・運営母体・拡張機能を、各社の公式情報にあたって比較しました。確認が取れなかった項目については、「非公表」「要問い合わせ」とそのまま記載しています。
続きを読む
2026年09月18日
Google Gemini 3.5 Transcribe × Agora Conversational AIでリアルタイム音声AIを構築する
※この投稿は、Agora の日本総代理店であるブイキューブが、Agora ブログをもとに作成した記事です。 音声AIエージェントでは、一般的に次のようなカスケード型のパイプラインが利用されています。 ユーザーの音声 → Speech-to-Text → LLM → Text-to-Speech → ユーザー Speech-to-Text(STT)がユーザーの音声をテキストへ変換し、LLMがその内容を理解して応答を生成、Text-to-Speech(TTS)がその応答を再び音声へ変換します。 Agora Conversational AIでは、この一連のパイプラインをリアルタイムRTCセッション内で管理できます。 Agora Agents SDK for TypeScriptのGeminiTranscribeSTTを利用することで、Google Gemini 3.5 TranscribeをSpeech-to-Text部分として利用しながら、それ以外のコンポーネントは特定のプロバイダーに依存しない構成にできます。 たとえば、Gemini 3.5 TranscribeをSTTとして利用しながら、 Gemini / OpenAI互換LLM MiniMax ElevenLabs Google TTS などを組み合わせることができます。 RTCやRTMについても、他のAgora Conversational AIエージェントと同じアーキテクチャをそのまま利用できます。 この記事では、 Gemini 3.5 Transcribeのサーバー側設定 AIエージェントの起動 ブラウザからRTCへ接続 RTM経由でTranscriptを受信 RTC + RTM Tokenの生成 Agentの停止 よくあるトラブル 本番環境でのチェックポイント Gemini 3.5のSmart Transcription まで、実装の流れをまとめて紹介します。
続きを読む
2026年08月10日
Agora CLIで始める開発効率化、 AIコーディングエージェント時代の新しい開発フロー
※この投稿は、Agora の日本総代理店であるブイキューブが、Agora ブログをもとに作成した記事です。 AI コーディングエージェントの進化によって、アプリケーション開発はこれまで以上に高速になりました。 GitHub Copilot 、 Cursor 、 Claude Code などを使えば、多くのコードは AI が生成してくれます。 しかし実際の開発では、「コードを書く前」の準備作業に意外と時間がかかります。 例えば Agora を利用する場合でも、 Agora Console でプロジェクトを作成 App ID を取得 .env を設定 Quickstart を探す SDK をセットアップ といった作業が必要です。 AI はコードを書けても、この初期セットアップはまだ人間が行うことがほとんどです。 そこで登場したのが Agora CLI です。 この記事では、 Agora CLI がどのように開発体験を改善し、 AI エージェント時代の新しいワークフローを実現するのかをご紹介します。
続きを読む
2026年07月31日
OpenAI は GPT-Live の遅延を公開していないため、実際に計測してみました
※この投稿は、Agora の日本総代理店であるブイキューブが、Agora ブログを翻訳した記事です。 スマートフォンを用いたテストにおいて、GPT-Live は割り込み時の沈黙までに 500 ミリ秒の遅延が見られたものの、旧世代モードで誤反応を招いていた背景音声(雑音)には反応しなくなり、前世代で 2.4 秒 かかっていたパケットロスへの対応を 314 ミリ秒の遅延に抑えました。 Agora Media Lab · 2026年7月10日 ※測定方法と制限については末尾に記載しています。 OpenAI は 7 月 8 日、「自然な」会話体験を実現する AI 音声機能として GPT-Live を発表しました。話しながら相手の声を聞き取り、ユーザーが考えている間は待ち、難しい質問については会話を止めることなくバックグラウンドの別モデルに処理を委ねるというものです。しかし発表内容には、実機でその「自然さ」がどの程度の数値に相当するのかというエンドツーエンドの計測データは含まれていませんでした。 そこで Agora のラボチームは、日々のテストで用いているのと同じ手法を使い、最新の ChatGPT アプリを検証しました。実機での動作確認に加え、再現性のある発話をする装置から入力し、ネットワーク障害を意図的に発生させ、すべての数値を 2 トラックの波形録音から読み取るという本格的なプロトコルです。対象としたのは、ChatGPT の音声インターフェースの 3 世代です。 GPT-Live-1:新しい全二重モード。電話のように、話しながら相手の声も聞き取れます。 Advanced Voice Mode:前世代のモード。音声から音声へ直接変換する単一モデルですが、厳密なターン制で、ユーザーが話し終えるのを待ってから応答します。 Standard Voice Mode:最初期の仕組み。発話を文字に起こし、テキストで返答を生成し、それを読み上げるという、1 ターンあたり 3 段階の処理を経ます。 私たちが把握している限り、これはユーザーが実際に体験する形(モデル・クライアント・ネットワーク・サーバー処理・再生をすべて含めた形)で GPT-Live を計測した、初めての公開実験データです。 特筆すべき結果は 3 つありました。4 つ目の傾向もラボ内で繰り返し見られたものの、数値化には至りませんでした。こちらは記事の最後で触れています。
続きを読む
2026年07月02日
会話型 AI のパフォーマンスを可視化する: Conversational AI Benchmark の見方と活用法
はじめに 近年、カスタマーサポートやバーチャルアシスタントの領域において、音声対話型の AI エージェント開発が急速に活発化しています。こうしたエージェントが「人間らしい」自然な対話を実現するためには、一般的に ASR (音声認識) 、 LLM (大規模言語モデル) 、 TTS (音声合成) という複数の高度な AI コンポーネントを連続して連携させる必要があります。 Agora Conversational AI Engine は、これらコンポーネントと連携し、Agora 社の独自ネットワーク ( SD-RTN™ ) を介して、クライアントと低遅延で対話可能な AI エージェントを構築するフレームワークソリューションとして提供されています。 しかしながら、このような低遅延伝送ネットワーク上でエンドツーエンドの通信が最適化されていても、 ASR、 LLM、 TTS それぞれの性能を正しく把握して組み合わせないと、 AI エージェントの応答速度 (レイテンシ) は大きく変動します。わずかな遅延の積み重ねがユーザー体験を大きく左右するため、「どのモデルを組み合わせれば、自社のサービスにとって最適なパフォーマンスとコストのバランスが実現できるのか?」という問いに対する解を見つけることは、開発における最も重要な課題の一つと言えるでしょう。 この課題に対し、Agora 社が客観的なデータに基づいてモデル選定を支援するために公開しているのが、Conversational AI Benchmark です。本ツールは、モデルごとのパフォーマンス、品質、コストを可視化し、開発者が客観的なデータに基づいて「自社にとってのベスト」を判断するための環境を提供します。 本記事では、この Conversational AI Benchmark を活用するための主要機能とその見方を解説します。
続きを読む
2026年06月30日
Convo AI World Japan 潜入レポート:対話型 AI の未来
対話型 AI が、単なる「効率化」のためだけではなく、「感情」「文化」「信頼」に基づいて設計されたとしたら、どのような可能性が広がるでしょうか。 2025年 11月 5日、Agora とブイキューブの共催により「Convo AI World Japan」が開催されました。本イベントには、世界的なテックリーダー、創業者、投資家が一堂に会し、対話型 AI、アバター、そしてマルチモーダル・インテリジェンスがどのように進化しているか、そしてなぜ日本の視点が国境を越えて重要視されるのかについて議論が交わされました。 リアルタイム翻訳やストリーミングアバターから、ロボティクスの伝統、文化的なストーリーテリングに至るまで、本イベントはアジア各地域の強みが融合し、世界の AI 体験における次の大きな飛躍に影響を与えている現状を明らかにしました。日本での議論の中心は、単なる規模の拡大ではなく「意味」にありました。すなわち、AI がいかに自然で、敬意を払い、人間らしい方法で人々の声に耳を傾け、応答し、つながりを持てるかという点です。 以下に、各セッションの要約と、素晴らしい登壇者たちがプレゼンテーションで語った主要なトピックを紹介します。 ※この投稿は、Agora の日本総代理店であるブイキューブが、Agora ブログを翻訳した記事です。
続きを読む
2026年06月29日
AIの「沈黙」がビジネスを停止させる?会話の“間”を極めるAgoraの正体
「……(沈黙)……あ、はい、承知いたしました」 ChatGPTなどのAIエージェントと話していて、この「1.5秒の微妙な間」にストレスを感じたことはありませんか?あるいは、自分が話し始めたのにAIが喋り続けてしまい、お互いに「あ、どうぞ」「すみません」と譲り合ってしまう“お見合い状態” 。 今、多くの企業がAIボットを導入していますが、その多くが「知能(LLM)は高いのに、会話のテンポが悪い(どんくさい)」という致命的な課題に直面しています 。 結論から言いましょう。音声会話の質を決めるのは「脳の賢さ」ではなく、「耳の良さと、呼吸を合わせるリズム感」です。今回は、その「リズム」を世界最高水準で実現する Agora.io の「ConvoAI」の正体に迫ります 。
続きを読む

