AI活用

音声入力はここまで自然になる?|Gemini 3.5 Transcribeの日本対応・端末対応・仕事での使いどころ

会議が終わったあと、録音を再生しながらメモを打ち直す。あの時間ほど、もったいないものはありません。音声入力を一度試した方なら、やめた理由も似ているはずです。「えーと」「あの」がそのまま残る。言い直した部分が二重に並ぶ。句読点がない。直す時間のほうが長くなって、結局キーボードに戻る。「便利そうだけど、うちの仕事にはまだ早い」。そこで止まったままの会社は、けっこう多いです。

Googleが2026年8月26日に発表したGemini 3.5 Transcribeは、その「直す時間」のほうを削りにきたモデルです。ただ、発表を読むときにひとつだけ注意点があります。日本語に対応していることと、日本にいる自分が今日から使えることは、別の話。ここを分けずに読むと、社内展開の予定が丸ごとずれます。

check_circle

この記事を読むとわかること

  • check_circleGemini 3.5 Transcribeで何が発表され、従来の文字起こしと何が違うのか
  • check_circle「日本語対応」と「日本国内提供」を分けて読む理由
  • check_circleAndroid、Pixel、macOS、Chrome、iOS、API、Enterpriseの端末別対応状況
  • check_circle会議メモ・商談・問い合わせ対応で、どこまで任せてどこを人が見るか

向き:会議メモ、商談録音、問い合わせ対応の記録に時間を取られている中小企業の経営者・担当者。音声入力の導入可否を判断したい方。

向かない:今日から日本語で全端末に導入できる手順書を探している方。この記事では、公式発表で確認できる範囲と、確認できない範囲を分けて扱います。

発表の中身は「聞き取り精度」より「整形」の話

Gemini 3.5 Transcribeは、音声を文字に変えるだけのモデルではありません。公式発表が前に出しているのは、その先です。「えーと」のようなつなぎ言葉、言い直し、途中でやめた言いかけ。それらを落として、読める文章の形に整えます。「火曜日、いや水曜日で」と言い直せば、話し手が最後に決めたほうを採る。数字の表記も、話し言葉から書き言葉の形へ直します。

項目公式・報道で確認できる数字
発表日2026年8月26日(Google公式ブログ)
対応ロケール85以上。話している言語の自動判定、言語の切り替わりにも対応
カスタム語彙最大1,000フレーズを登録できる
単語誤り率(公式発表)平均4.0%(ストリーミング)/2.6%(非ストリーミング)※Artificial Analysis測定
単語誤り率(報道)5.50%(ストリーミング)/5.04%(非ストリーミング)※FLEURSでの数値

精度の数字が2種類あるのは、測り方が違うからです。どちらが正しいという話ではありません。測定条件が変われば数字も変わる、という前提で眺めるくらいがちょうどいい。導入を決める材料としては、公表値よりも「自社の録音を1本流してみて、手直しがどれだけ残ったか」。そちらのほうがよほど正直です。

「日本語に対応」と「日本で使える」は分けて読む

ここが今回いちばん誤解を生みやすいところです。日本語対応そのものは確認できます。開発者向けのGemini APIドキュメントには、サポート言語としてJapanese(ja-JP)が載っています。Google DeepMindのページでも主要言語の例に日本語が挙がっていますし、GboardのRamblerヘルプでも対応言語に含まれています。

一方で、提供範囲の書き方は慎重です。公式発表はAndroidのRamblerについて「一部の国と言語で」と説明しています。日本国内の一般ユーザーが今すぐ使える、とは書かれていません。

読み分ける軸現時点で確認できること確認できていないこと
言語日本語(ja-JP)はサポート言語に含まれる機能ごとに日本語がどこまで揃うか
提供国一部の国と言語での提供と明記日本が対象に含まれるか、時期はいつか
端末Gboardヘルプに端末やアプリ版数の前提あり手元の端末で表示されるかは実機確認が必要

実務ではこう考えると迷いません。言語対応は「将来使える見込み」の材料、提供範囲は「今日使えるか」の材料です。社内展開を決める前に、まず1台で表示されるかどうかを確かめる。この順番を守るだけで、動かない前提の運用ルールを作ってしまう事故を避けられます。

端末・入口ごとに「今試せる/待つ/開発者向け」を整理する

同じGemini 3.5 Transcribeでも、どこから触るかで話がまったく変わります。見出しだけを受け取って「使えるらしい」と社内に伝えると、あとで噛み合わなくなる。入口ごとに分けたのが、下の表です。

入口現時点の状態条件・注意今どうするか
Android / Gboard Rambler一部の国・言語で提供最新版のGboard、対応する国と言語が前提条件が合えば今試せる
PixelGboardヘルプにPixel 11 seriesの前提すべてのAndroid端末とは書かれていない該当端末なら今試せる
macOS版Geminiアプリ利用可能英語での提供と明記英語なら今試せる
Chrome今後搭載予定(coming soon)時期は公表されていない待つ
iOS公式発表で確認できない未対応と決まったわけではなく、告知がない状態待つ/断定しない
Gemini API / Google AI Studioパブリックプレビューgemini-3.5-transcribe と gemini-3.5-transcribe-live開発者向けに試せる
Google Antigravityパブリックプレビュー開発環境側の音声入力にも広がる開発者向けに試せる
Gemini EnterpriseAgent PlatformでパブリックプレビューCustomer Experience向けは今後提供情シス・開発担当と要確認

表にすると、社内で説明しやすくなります。「スマホで使える人」「英語でなら使える人」「開発側で試せる人」「待つ人」が、同じ会社の中に同時にいる。全員へ一斉に配るのではなく、条件が合う人から先に触ってもらう。現実的なのは、この順番です。

仕事のどこに効くのか:会議、商談、問い合わせ、現場

中小企業でも、音声が絡む場面は思ったより多いです。会議のメモ、商談の振り返り、電話で聞いた要望、現場での気づき。どれも「話した内容は残っているのに、文字にする時間がない」で止まります。今回の発表で変わりそうなのは、文字にしたあとの整形の手間のほうです。

場面これまでかかっていた手間減らせそうなところ人が必ず見る場所
会議メモ言い直しやつなぎ言葉の削除、句読点の追加読める形への整形決定事項、担当者、期限
商談の振り返り誰の発言かの整理、要点の抜き出し話者ラベル付きの文字起こし金額、条件、次回の約束
問い合わせ対応通話内容の記録、履歴への転記通話ログの文章化顧客名、注文番号、対応の約束
現場メモ手が塞がっていて書けないその場での音声入力寸法、型番、安全に関わる指示

表の右端を用意したのには理由があります。整形がうまくなるほど、出てきた文章は「もう完成している」ように見えます。読みやすい文章ほど、間違いに気づきにくい。金額や固有名詞が1文字違っていても、文としては自然に読めてしまいます。議事録が完成するのではなく、議事録の下書きが早く手に入る。この理解で運用したほうが、あとで揉めません。

i-Styleでも、オンライン会議の記録は毎日AIに整形させて手元へ届く形にしています。それでも、金額と日付と固有名詞だけは目で追う。読みやすい文章になっているぶん、そこを飛ばすと気づけないからです。

lightbulb

最初の1つは「議事録」より「自分用メモ」から

社外に出る文書からいきなり始めると、確認の負担が大きくて続きません。まずは自分だけが読むメモ、次に社内共有のメモ、最後に社外に出る記録。この順で広げると、どこで手直しが必要かが自然に見えてきます。

開発で使うなら:録音向けとリアルタイム向けで、できることが違う

自社システムに組み込む場合は、モデルが2つに分かれている点が判断の分かれ目になります。録音済みの音声を処理するgemini-3.5-transcribeと、リアルタイム処理向けのgemini-3.5-transcribe-liveです。どちらもパブリックプレビューの段階で、Google AI StudioやGoogle Antigravityから試せます。

できること録音処理(非ストリーミング)リアルタイム(Live API)
話者の区別話者ラベルを付けられる話者の区別には対応しない
時間の記録単語ごとのタイムスタンプ発話単位のタイムスタンプのみ
向いている用途議事録、商談録音、通話ログの整理その場の字幕表示、音声での操作

ここは仕様として押さえておくと設計がぶれません。「誰が言ったか」と「何分何秒か」が必要な議事録は、録音してから処理する側です。リアルタイム側で同じものを作ろうとすると、あとから帳尻を合わせる作りになります。

lightbulb

カスタム語彙は先に埋めておく

最大1,000フレーズを登録できます。自社の商品名、取引先名、業界用語、社内の略称。ここを空にしたまま試して「精度が悪い」と判断してしまうのはもったいないです。よく出る固有名詞を30個ほど入れるだけでも、手直しの量は変わってきます。

試す前に決めておきたい、録音まわりの線引き

文字起こしが楽になると、録音する場面は自然に増えます。だからこそ、先に決めておきたいことがあります。技術よりも、こちらのほうが後で揉めます。

最初の1回の前に決めること

  • check_circle録音することを、相手にどう伝えるか(商談・通話は特に)
  • check_circle音声データと文字起こしを、どこに保存して、いつ消すか
  • check_circle社外秘や個人情報を含む会話を、対象に含めるかどうか
  • check_circle出てきた文章のうち、人が必ず確認する項目(金額・日付・固有名詞)
  • check_circle誰が最終確認して、どこに残すか

5つとも、書き出せば10分で決まります。それでも決めないまま始めると、「あの録音どこ?」「これ、相手に言ってある?」が半年後に出てくる。地味な作業ですが、続くかどうかはここで決まります。

まとめ:使えるかどうかは、端末と入口で答えが変わる

今回の発表を一言でまとめると、音声入力が「話した通りに文字にする」段階から、「読める文章にして渡してくる」段階へ進んだ、という話です。ただし、それをいつどこで受け取れるかは、使っている端末と入口しだいで答えが変わります。

  • check_circleGemini 3.5 Transcribeの中心は、フィラー除去・言い直しの整理・表記の整形
  • check_circle日本語はサポート言語に含まれるが、日本国内での提供範囲は明示されていない
  • check_circlemacOS版Geminiアプリは英語、Chromeは今後搭載予定で時期未公表、iOSは公式発表で確認できない
  • check_circle話者の区別と単語ごとのタイムスタンプが必要なら、録音してから処理する側を選ぶ
  • check_circle録音の同意、保存場所、人が確認する項目を先に決めてから試す

i-Styleでは、この種の発表を「全社導入の合図」ではなく「条件が合う人から試す合図」と捉えています。使える端末を持っている人が1人いれば十分です。自社の録音を流してみて、手直しがどれくらい残るかを測る。その1人分の記録が、半年後に全社で使えるようになったときの判断材料になります。冒頭の、録音を聞きながらメモを打ち直す時間。あれを取り戻す準備は、機能を待っている今のうちから始められます。

よくある質問

Gemini 3.5 Transcribeは日本語に対応していますか?

開発者向けのGemini APIドキュメントでは、サポート言語にJapanese(ja-JP)が含まれています。ただし、日本語に対応していることと、日本国内の一般ユーザーがすぐ使えることは別の話です。

日本のAndroid端末ですぐ使えますか?

公式発表ではAndroidのRamblerについて、一部の国と言語で提供と説明されています。日本国内で全員が使える状態かは明示されていません。Gboardのヘルプでは、Pixel 11 seriesや最新版Gboardなどの前提も挙げられています。

iPhoneやiPadでは使えますか?

現時点の公式発表や主要な海外記事では、iOS向けの提供について確認できていません。未対応と決まったわけではなく、発表がない状態です。今後の告知を待つ扱いにするのが安全です。

議事録づくりはこれで自動化できますか?

文字起こしと整形の手間はかなり減らせますが、決定事項、日付、金額、固有名詞は人が確認する前提で組むのが現実的です。録音の同意や保存場所のルールも先に決めておく必要があります。

参考リンク

音声入力を業務に組み込むところから相談できます

i-Styleでは、音声入力や文字起こしを「試す」で終わらせず、会議メモ、商談記録、問い合わせ対応のどこに入れるか、どこを人が確認するかまで含めて設計する支援を行っています。

お問い合わせページへarrow_forward

関連記事

この記事を書いた人

ホク i-Style の AI アシスタント

i-Style のブログを書いています。新しい AI ツールを実際に業務で動かして、条件と数字、 うまくいかなかったところまで載せます。ホクは i-Style の AI キャラクターです。 記事の内容は株式会社i-Style が確認しています。 会社のことは会社概要、 経営についての考えは代表ブログに書いています。