Clef-omniとは​──音声・動画も​扱う​Cloudflareの​判断AI

文章・写真・音声・動画を材料に、担当部署などの選択肢を評価するAIです。問い合わせを振り分ける仕組み、公式料金、導入前の確認点を紹介します。

甲斐ショウジ甲斐ショウジ
CAG主宰/合同会社ATK CAIO(最高AI責任者)
技術9分で読めます
技術Clef-omniとは──音声・動画も扱うCloudflareの判断AI

Cloudflareは2026年10月9日、文章・画像に加えて音声と動画を扱う判断モデル「Clef-omni」を発表しました。問い合わせに添付された写真や録音を材料に、担当部署や確認項目を選ぶためのAIです。[1]

Clef-omniは、用意した質問と選択肢に対して確率を返します。その結果を使って問い合わせを振り分けたり、人の確認に回したりする仕組みを組めます。この記事では、判断モデルの仕組み、問い合わせ対応での使い方、料金、導入前の確かめ方を紹介します。

情報・料金は2026年10月10日時点の公式資料に基づきます。CAGではClef-omniのAPI実行や精度・速度の検証を行っていません。本文の業務例と図は、使い方を説明するための架空の設計例です。

設備の写真・録音・動画から担当キューに振り分ける架空の受付画面
問い合わせを振り分ける用途を表すAI生成イメージ。Clef-omniの実画面やAPI実行結果ではありません。

01 Clef-omniは​「次に​どう​扱うか」を​選ぶAI

判断モデルの入力と出力問い合わせ情報質問と選択肢候補ごとの確率運用ルール担当へ回す情報と質問を渡し、結果を処理につなぐモデルの出力を、アプリ側のルールで扱う判断モデルの入力と出力問い合わせ情報質問と選択肢候補ごとの確率運用ルール → 担当へ
質問と選択肢を用意し、返った結果をアプリの運用ルールにつなげる仕組みの図。

判断モデルは、問い合わせなどの情報を読み、あらかじめ定めた分類や選択肢を評価するAIです。Cloudflareが2026年10月1日に発表したClefの説明では、顧客からのメッセージを読み、緊急性や担当部署を判断する用途が例に挙げられています。返ってくる型付きの回答と確率を、アプリ側の処理につなげる考え方です。[2]

たとえば「この問い合わせは、請求・技術・営業のどこが担当するか」という質問なら、その候補を先に渡します。部署名を自由に書かせる方式と比べ、受け取った回答を既存の受付システムの分類に対応させやすくなります。

Clef-omniのモデルカードには、自由形式の文章を生成せず、各質問で許可された選択肢の確率を返すと説明されています。モデルの重みはApache 2.0ライセンスで公開され、CloudflareのWorkers AIで使う方法と、自前で動かす方法があります。[3]

仕事への組み込みでは、質問と選択肢の設計が出発点になります。「対応しておいて」と広く任せるより、「請求の質問か」「不具合の連絡か」「追加情報が必要か」と、受付で実際に分けたい判断を用意するほうが、結果を作業につなげやすいからです。

なお、モデルが分類を返すことと、顧客に返信したり返金したりすることは別の処理です。どの結果なら担当を割り当てるか、どこから人が確認するかは、導入する側が決めて実装します。

02 音声と​動画が、​問い​合わせの​判断材料に​なる

文章、写真、録音、動画を判断材料にする文章写真録音動画Clef-omni複数の材料を使い、質問を評価する文章、写真、録音、動画を判断材料にする文章写真録音動画Clef-omni質問に沿って判断
入力の種類を示す概念図。各入力には時間・本数・容量などの上限があります。

Clef-omniで加わったのは、録音や動画も入力にできることです。発表では音声のWAV・MP3、動画のMP4・WebMに対応すると説明されています。写真、録音、動画を同じリクエストで渡し、設置状況や動作音などを確認する例も紹介されています。[1]

たとえば設備の問い合わせでは、お客様が「変な音がする」と書いた文面に、録音と短い動画が添付されることがあります。その材料を使って「技術担当に確認を回す必要があるか」を評価する用途が考えられます。これは本記事の設計例であり、故障の診断能力を確認したものではありません。

2026年10月10日時点の公式仕様には、次の上限が載っています。[4]

項目 Clef-omniの入力上限
コンテキスト 64,000トークン
画像 1回のリクエストに最大4枚
音声 最大4本、1本あたり最大300秒
動画 最大2本、1本あたり最大60秒

トークンは、AIが処理する情報量を数える単位です。文章だけでなく画像・音声・動画もトークンに換算され、質問と一緒に入力枠を使います。メディアと質問だけで上限を超えるとリクエストは失敗し、それ以外の場合は残りの枠に収まるよう文章の入力が切り詰められます。[4]

**長い録音や動画を、そのまま全部送ればよいとは限りません。**受付に必要な箇所を絞り、判断に必要な説明が入力から欠けていないかを確認する設計が必要です。添付の長さを制限する場合も、上限に達したことを利用者に伝え、別の提出方法を用意すると受付を続けられます。

03​ 架​空の​問い​合わせで、​振り分けの​流れを​考える

担当キューと人の確認への振り分け架空の設備問い合わせ担当の候補を評価候補が明確担当キューへ候補が近い・材料不足受付担当が確認分岐条件は導入側が定める設計例担当キューと人の確認への振り分け架空の問い合わせ担当の候補を評価候補が明確担当キューへ候補が近い・材料不足受付担当が確認運用の分岐を示す概念図
架空の受付フロー。モデルを実行した結果ではなく、導入側が用意する分岐の設計例です。

ここでは、設備を販売する会社の受付を想定します。届いた内容は「設置後、運転すると異音が出ます。写真と録音を添付しました」。最初に決めたいのは、誰に回すか、急いで見る必要があるか、確認材料が足りているかです。

モデルに渡す質問は、業務上の判断に対応させます。

決めたいこと 質問の例 用意する判断軸
担当部署 どの担当が確認すべきか 請求/技術/営業/人による受付確認
優先度 すぐに確認が必要な連絡か 緊急性を評価する
情報の不足 製品と症状を確認する材料がそろっているか 追加確認の必要性を評価する

公式APIの例では、選択肢から選ぶchoice、真偽を評価するnoul、段階を評価するscoreが使われています。担当部署と緊急性のように、異なる種類の質問を同じ入力にまとめられます。[4]

その後の振り分けは、運用ルールとして用意します。たとえば技術担当の候補が明確なら担当キューへ、候補が近いときや材料不足のときは受付担当の確認へ回す、という分岐です。本記事では説明のためにこの分岐を描いており、実際のモデル回答や確率の数値は載せていません。

**返ってきた確率を、そのまま業務での正解率と読み替えないことも大切です。**請求と不具合の相談が一通に混ざるケースなどでは、どの部署を主担当にするかという社内ルール自体が必要になります。AIの出力を読む前に、人が同じ問い合わせをどう扱うかをそろえておくと、振り分け結果を評価できます。

はじめは担当キューへの割り当て案を表示し、担当者が確定する運用から試す方法があります。誤りの種類が分かってから、自動で割り当ててよい範囲を広げる設計です。

添付された設備写真と録音を担当者が確認する架空のサポート画面
担当者が添付資料を確認する運用を表すAI生成イメージ。実際に生成・操作した画面ではありません。

04 料金は​入力トークン単価で​見る

Clefシリーズの入力トークン単価入力100万トークンあたり(米ドル)Clef-omni$0.150Clef$0.240Clef-flash$0.0382026-10-10時点 · Workers AI公式料金Clefシリーズの入力トークン単価入力100万トークンの単価Clef-omni$0.150Clef$0.240Clef-flash$0.038米ドル · 2026-10-10時点
公式単価の比較。棒は価格の比率を表し、速度や精度の比較ではありません。

2026年10月10日時点のWorkers AI公式料金表では、Clefシリーズの入力100万トークンあたりの単価は次のとおりです。[5]

モデル 入力100万トークンの単価(米ドル)
Clef-omni $0.150
Clef $0.240
Clef-flash $0.038

横にスクロールして、モデルの単価を比較できます。

Clefモデルには出力トークンの課金がなく、画像・音声・動画から換算されたトークンも、それぞれの入力単価で計算されます。[4] 単価が低いモデルが、すべての仕事で適しているわけではありません。入力の種類と、自社の問い合わせに対する分類結果を合わせて選びます。

計算例として、文章・質問・メディアを合わせた課金対象の入力が、1件あたり平均1,000トークンだったと仮定します。10,000件なら合計10,000,000トークンなので、Clef-omniのモデル利用分は**$1.50**です。これは公式単価を用いた単純計算で、実測した利用料ではありません。無料枠や税、受付アプリ、保存先、その他の処理の費用も含めていません。

実際の予算を出すには、代表的な問い合わせを流して消費量を確かめる必要があります。本文が短くても添付動画が長ければ、1件の入力量は増えます。想定件数に単価だけを掛ける前に、「通常の問い合わせ」「添付が多い問い合わせ」「再判定した問い合わせ」を分けて記録すると、費用の増える箇所が見えます。

05 導入は、​小さな​受付分類から​始める

小さな受付分類で導入を評価する受付分類を一つ選ぶ人の判断と比較する運用範囲を見直す誤配の理由人の確認処理時間入力量小さな受付分類で導入を評価する受付分類を一つ選ぶ人の判断と比較する運用範囲を見直す誤配の理由人の確認処理時間入力量
導入時に確認する項目の提案。CAGで実施した検証結果ではありません。

試すなら、扱う問い合わせと、AIに選ばせる範囲を絞ります。最初の対象を「担当部署の候補を出す」だけにすれば、返信の内容や返金の判断を同時に評価する必要がありません。

確認用の問い合わせには、典型的な例に加えて、判断が割れそうな例も入れます。たとえば請求と故障が混ざった連絡、聞き取りにくい録音、別製品が写った写真、説明と添付が食い違うケースです。実データを使う前に、送信先や保存方法の社内ルールを確認し、架空・匿名化した材料で試す方法もあります。

評価するときは、分類の一致だけでなく、人の確認へ回せたかも記録します。誤って自動割り当てされた案件と、慎重に確認へ回した案件では、その後の負担が違うからです。日本語の問い合わせ、業界特有の略語、現場の騒音についても、自社の材料で確かめる必要があります。CAGではこれらの精度を検証していません。

導入前に決めること 最初の運用例
AIに選ばせる範囲 担当部署と追加確認の必要性
判断が割れたとき 受付担当へ回す
誤りを確かめる方法 人の分類と比較し、誤配の理由を記録する
自動化を広げる条件 自社の問い合わせで許容できる誤りと費用を確認する

Clef-omniは、写真や音声も含む受付情報から、次の扱いを選ぶための道具です。導入の出発点は、受付でいつも行っている判断を一つ選び、質問・選択肢・人へ戻す条件を用意すること。その小さな分岐なら、自社で使えるかを具体的に確かめられます。

出典・確認範囲

  1. Cloudflare公式ブログ「Introducing Clef-omni with full multimodality, plus a faster Clef and a cheaper Clef-flash」(2026-10-09発表、2026-10-10確認)。対応入力と発表日を参照。速度・精度のベンダー評価はCAGの実測として扱っていません。
  2. Cloudflare公式ブログ「Introducing Clef: our open-source decision models, and new RL fine-tuning platform」(2026-10-01発表、2026-10-10確認)。判断モデルの役割と問い合わせ分類の説明を参照。
  3. Cloudflare公式モデルカード「Cloudflare/clef-omni」(2026-10-10確認)。型付き出力、自由形式の文章を生成しない設計、公開ライセンスを参照。
  4. Cloudflare公式ドキュメント「clef-omni」(2026-10-10確認)。入力上限、質問の型、メディアの課金と入力枠の扱いを参照。入力には本数・時間以外の容量制限もあるため、実装時は原文を確認してください。
  5. Cloudflare公式ドキュメント「Workers AI Pricing」(2026-10-10確認)。単価の表はこの日時点。$1.50の例は仮定した入力量によるCAGの単純計算です。

言語化できるものは、全て作る。

あなたの「作りたい」を、定価とスピードで形に。まずは無料の相談から。

制作事例を見る