9月3日に出たGPT-6 Astraを、海外で先に使い始めたのは法務・金融・開発ツール・映像制作の会社でした。共通しているのは、作業手順がすでに文書になっている職種だという点です。
新しいモデルが出るたび、ご相談では「海外ではもう、どんな会社が使っているんですか」と聞かれます。導入するかどうかの判断材料として、いちばん知りたいところだからだと思います。
当社でも触っていますが、日本語の解説はまだ発表内容の要約が中心です。そこで今回は、海外の一次ソースだけを追いました。評判が実際どこで割れているのかまで並べます。
先にまとめ
目玉は文章を書く力ではなく、画面をそのまま操作する力のほうです。入力フォームの記入や顧客情報の更新を、人と同じように画面の上でこなします。
評判は割れています。見出しになった99.9%という数字は、第三者が共通の条件で測ると62.7%まで下がります。実際に使った人からは「途中で止まる」「利用枠がすぐ減る」という声も同じ日に出ていました(2026年9月6日時点)。
先に手を挙げたのは、手順が決まっている職種だった
OpenAIの発表ページには、公開時点ですでに使い始めた会社のコメントが並んでいます。顔ぶれを見ると、業種の偏りがはっきり出ています。
法務向けAIを手がけるHarveyは、複雑な法務作業での質の向上を挙げています。確定した記録と、まだ確定していない書類とを分けて扱う。裏づけのない思い込みがあれば表に出す。抜けている点は、そのまま次に書くべき論点として示す。そういう働き方に近づいた、という説明です。
金融のJane Streetは、社内のコーディング評価で最高値が出たとしています。加えて、エージェントとして動かしたときの説明が追いやすく、実務水準に届くまでの手戻りが減ったと述べています。
開発エージェントDevinを作るCognitionは、公開当日に自社の仕組みへ組み込んだと書いています。テスト工程がそのまま良くなり、報告の文章が読みやすくなった、という書き方でした。
アプリ生成のLovableは、考える強さを低・中・高の3段階で試し、前世代より明確に上だったとしています。映像・画像のHiggsfield AIは、最も複雑な制作工程を完遂しながら、使うトークンが他のモデルより最大2割少なく済んだと述べています。
Microsoft側の発表(9月4日)では、Foundry経由の利用者として開発環境のReplitと、食品小売のAlbertsons Companiesが挙がりました。後者は、導入の速さと統制のバランスを取る土台として使う、という趣旨です。
| 分野 | 発表に載った会社 | 何が良くなったと言っているか |
|---|---|---|
| 法務 | Harvey | 確定した記録と書類を区別し、裏づけのない前提を表に出す |
| 金融 | Jane Street | エージェントとして動かしたときの説明が追いやすく、手戻りが減った |
| 開発エージェント | Cognition(Devin) | 公開当日に組み込み、テスト工程と報告文がそのまま改善 |
| アプリ生成 | Lovable | 考える強さを上げるほど検証が増え、前世代より明確に上 |
| 開発環境 | Replit | コードを書かせるだけでなく、そのまま作らせる段階に入った |
| 映像・画像制作 | Higgsfield AI | 複雑な制作工程を完遂しつつ、使うトークンが他モデル比で最大2割少なく済んだ |
| 小売 | Albertsons Companies | 導入の速さと統制のバランスを取る土台として |
並べてみると、法務・開発ツール・映像制作の各社は、自社のAI製品にAstraを組み込む形の利用でした。自分たちの業務に使っている一般の事業会社は、金融と小売の2社です。
つまり今の中心は、AIを作っている側が自社製品に組み込んだところです。ふつうの会社が日々の業務で回した例は、これから出てくると見ています。
ただし、各社が挙げている評価の中身を見ると、褒められているのは文章のうまさではありません。もっと手前の、実際に手を動かす部分でした。
目玉は「パソコンをそのまま操作する」ほうにある
OpenAIは発表ページで、Astraを「世界で最も優れたコンピュータ操作モデル」と表現しています。前に出したのは文章を書く力ではなく、画面を見て自分で操作する力でした。
例として並んでいるのは、入力フォームの記入、顧客管理システムの情報更新、予定表の整理です。調べものをして結果をメールや文書に下書きする、作ったサイトの動作確認をする、ソフトの導入や不具合の切り分けをする、といった作業も挙がっています。
ここが中小企業に効きそうに見えるのは、システムどうしの連携をわざわざ作らなくて済む点です。現場では、アプリごとに接続を開発する費用がそもそも予算に乗らない、という話をよくお伺いします。
速さの数字も出ています。OSWorld 2.0という画面操作の試験を使った模擬では、1つの作業に約40分かけて72.6%。前の世代は約75分で65.7%だったので、1作業あたりの時間が約47%短くなった計算です。
ただし読み方には注意が要ります。人が5分で終える作業に40分かけている、という見方も同時に成り立つためです。
当社でもAIに画面を操作させる使い方は実際に続けています。担当していて感じるのは、任せられるかどうかが性能ではなく、手順の固まり具合で決まるということです。
ただし、こうした点数の伸びも額面どおりには受け取れません。見出しを飾った数字ほど、測り方から見る必要があります。
賞賛の数字は、測り方を変えると下がる
見出しを飾ったのは、ARC-AGI-3という試験での99.9%という数字でした。この試験を運営するARC Prize Foundationの担当者も、これまで試した中で最良のモデルだという趣旨のコメントを公式ページに寄せています。
一方で、同じ団体が自分たちの記録に載せている数字は2つあります。測定を仲介する外側の仕組み、いわばモデルに試験を受けさせるための机の作りが違うためです。
提供元が自社のモデルに合わせて用意した机で測ると99.9%。どの会社にも同じ条件を課す共通の机で測ると62.7%でした(試験費用はそれぞれ約1万9千ドルと約2万6千ドル)。
ARC Prizeは、共通の仕組みのほうを「提供各社を同じ条件で比べるためのもの」と説明しています。社をまたいで比べられるのは62.7%のほう、ということになります。
総合的な指標でも見え方が変わります。独立して測っているArtificial Analysisには、複数の試験をまとめてAIの総合力を並べるIntelligence Indexという指標があります。100点満点の点数ではなく、他のモデルと比べるための指数です。その最新版では、GPT-6 Astraの最大設定が指数55で、掲載202モデル中2位でした。
| 何の数字か | 発表側が前に出した値 | 共通条件で測った値 |
|---|---|---|
| ARC-AGI-3(初めての環境への適応) | 99.9%(提供元の仕組み・約1万9千ドル) | 62.7%(共通の仕組み・約2万6千ドル) |
| 総合的な知能の指標 | 発表資料には掲載なし | Intelligence Index v4.2で55(202モデル中2位) |
| 画面操作(OSWorld 2.0の模擬) | 72.6%・1作業あたり約40分 | 第三者による同条件の測定は未公表 |
ここから持ち帰れるのは、数字そのものではありません。ベンチマークは「どの仕組みで測ったか」まで見ないと比べられない、という一点だと捉えています。
使った人が挙げているのは、速さより「止まる」こと
使う側が自分で測った結果も出ています。コードレビューを自動化しているCodeRabbitは、指摘として実際に使えるバグの検出率を測りました。
全体では61.3%で、前の世代の59.0%、別の会社の上位モデルの50.2%を上回りました。複数のファイルをまたいで読む難しいレビューでは57.1%となり、47.6%・42.9%との差がさらに開いています。
ただし同社は、これを早い段階で方向を見るための結果だと断ったうえで、費用に触れています。100万トークンあたり入力10ドル・出力50ドルは前の世代の2.5倍で、例に挙げた1件のレビューでは1.50ドル対0.60ドルでした。
同社が出した結論は、点数ではなく「成功1件あたりの総費用」を自分の仕事で測るべき、というものです。ここは当社の見方とも重なります。
開発者向けの掲示板Hacker Newsに立った公開初日の議論では、褒める声と不満が同じ場所に並びました。調べもので当たる情報源が3〜5倍に増えた、3Dの造形が別物になった、といった評価が出ています。
その一方で、5時間ぶんの利用枠を15回のやり取りで使い切った、画面操作は1操作あたり45秒ほどで速くなった実感がない、という書き込みもあります。作業の途中で理由なく止まる、指示から外れる場面が前の版より増えた、という指摘も並んでいました。
個人の投稿なので、件数として扱えるものではありません。ただ、止まる・枠が減るという方向は揃っていました。
現場で見えていること
当社にも、夜間に長く走らせている処理があります。人がいない時間に確認を求められると、そこで朝まで止まります(2026年9月時点)。海外の書き込みにある「途中で止まる」は、性能というより、誰がいつ返事をするかを決めていない運用の話として読んでいます。
評判が割れているのは、性能と使い勝手だけではありません。安全側の評価も、まだ定まっていないところがあります。
安全側の評価は、まだ落ち着いていない
OpenAIは、サイバー分野で自社基準の「Critical(重大)」に初めて達したモデルだと書いています。ここは賞賛でも不満でもなく、配り方に直結する部分です。
既知の弱点を実際に突けるかを測る試験では100%で、前の世代は78.5%でした。評価の最中に、まだ知られていない弱点を2件見つけ、開発元への通知を進めているところだとも書かれています。
そのため出荷された版は、攻撃の実証コードを作るような依頼を断ります。審査を通った枠で段階的に緩めていく、という進め方です。配布が順番待ちになった経緯は別の記事にまとめています。
一方で、安全性の報告書には気になる記述もあります。途中の考えを外から追える度合いが前の版より大きく下がり、評価を受けていると気づく場面も増えた、という点です。これも、配布を急がない理由の一つになっていると見ています。
中小企業の日々の業務に、この話が直接効くわけではありません。それでも、配布がここまで慎重になっている理由はここにあると見ています。
日本の中小企業が、ここから持ち帰れること
この記事を書く前に立てた見立ては、外れました。「人手が足りない会社ほど画面操作が効く」と考えていたのですが、社内で詰めた結論は「効くが、効く相手は限られる」でした。
理由は、海外の顔ぶれと合っています。先に使い始めたのは法務・金融・開発と、手順がすでに文書になっている職種でした。手順が人の頭の中にある会社では、毎回説明することになります。
提供面にも制約が残っています。Microsoftの価格表に並んでいるのはGlobalとUS Data Zoneの2つで、処理する場所を日本や欧州の中に閉じたい要件では、いまのところ選べません(2026年9月6日時点)。
費用は、いちばん標準的な契約で、日本語なら数十万字ぶんのやり取りに対して入力10ドル・出力50ドルです。一度読ませた資料を使い回す分は1ドルまで下がります。一度に渡す資料が長くなると、入力20ドル・出力75ドルへ切り替わります。
順番として当社では、任せる範囲を先に紙へ書くところからお伝えしています。読んでよい場所、承認が要る操作、やらせない操作の3つに分けるだけで、事故の形が変わります。
最初の対象に、金額が動く操作や顧客データの書き換えを選ばないでください。取り消せない作業から始めると、1回の失敗で運用そのものが止まります。
発表から3日で、賞賛と冷めた評価が同じ速さで出そろいました。片方だけを読むと判断を誤ります。
いまの段階で契約を動かすより、自社の作業を1つ選んで両方に通してみるほうが早いと捉えています。画面操作を試すなら、失敗しても取り消せる作業から選んでください。
参考にしたソース
確認日はいずれも2026年9月6日です。価格・提供条件・評価の数値は随時変わります。
OpenAI公式: GPT-6 Astra: A new generation of intelligence(2026年9月3日)
OpenAI: GPT-6 Astra System Card(Deployment Safety Hub)
Microsoft Azure公式: GPT-6 Astra: Frontier intelligence for work, now available in Microsoft Foundry(2026年9月4日)
ARC Prize Foundation: OpenAI's GPT-6 Astra on ARC-AGI-3
Artificial Analysis: GPT-6 Astra(Intelligence Index v4.2)
CodeRabbit: GPT-6 Astra review: code review gains, privacy, and cost
Hacker News: Ask HN: Initial Thoughts on GPT-6 Astra?(個人の投稿。件数の裏づけはありません)
数字を社内の資料に使う前に、必ず元のページで自分の契約の条件を確かめてください。
i-Styleに相談する
「海外で使われている」と聞いても、自社のどの作業に当てはまるかは別の話です。i-Styleでは、いまある作業を書き出して、任せてよい範囲と人が見る範囲を分けるところから一緒に整理しています。作業1つからで構いません。
お問い合わせページへ arrow_forwardそこまでではない、という段階なら、botに聞いて論点を整理するところからでも間に合います。