<img height="1" width="1" style="display:none" src="https://www.facebook.com/tr?id=139163818022217&amp;ev=PageView&amp;noscript=1"> <img height="1" width="1" style="display:none" src="https://www.facebook.com/tr?id=271598307802760&amp;ev=PageView&amp;noscript=1">

Gemini 3.7 Flashを実際の企業ナレッジワークで検証

 公開日:2026.09.03  Box Japan

Boxでは、お客様が実際に利用する方法で最先端モデルを評価しています。つまり、複数の文書にまたがる複雑な業務タスクを使い、完成した成果物が正確か、そしてどれだけ速く完成したかを評価します。今回、Gemini 3.7 Flashをこの評価にかけ、Gemini 3.6 Flashと比較しました。結論を簡潔に言えば、Gemini 3.7 Flashは大幅に精度が高く、しかもより速く成果に到達しました。

BoxのComplex Work Evalは、12の業界と、分析、ソースデータからのレポート作成、デューデリジェンス、他者の成果物の誤りのレビューといったナレッジワークの中核業務を対象とする、現実的な文書ベースのタスク群です。各タスクは、適切な文書を見つけ、スプレッドシート、PDF、プレゼンテーション、画像を横断して推論し、ナレッジワーカーが実際に引き渡せる成果物を作成するAIエージェントによって、最初から最後まで実行されます。

すべての成果物は、独立した評価者が採点する、約20〜30項目の重み付けされた詳細な評価基準に基づいて評価されます。一部の基準にはマイナスの重みが設定されているため、自信を持って誤った回答をすると減点されます。各タスクを複数回実行し、そのスコアを平均しました。

今回の評価では、Gemini 3.7 Flashは67%を記録し、Gemini 3.6 Flashの62%を上回りました。また、直接対決でも過半数のタスクで勝利しました。この改善は幅広い領域に及んでおり、特に最も難しい業務で顕著に現れています。

Box20AI20Complex20Work20Eval20for20Gemini203

改善が見られた領域

分析の難易度が高くなるほど、Gemini 3.7 Flashの優位性は大きくなります。最も大きな改善が見られたのは、徹底的な調査が必要なデューデリジェンスと、不完全なソースデータから根拠のある数値を算出するデータ分析です。

代表的な例として、1年分の取引記録を使い、ベンダーの価格設定ツールを検証してすべての計算ミスを報告させる財務デューデリジェンスタスクがあります。性能の低いAIモデルは明らかなケースだけを確認し、ツールに誤りはないと結論づけ、さらに誤った数値まで示しました。一方、Gemini 3.7 Flashは全データを確認し、誤っていた具体的な取引を特定し、根拠のない主張は行いませんでした。

このようなタスクでは、「徹底しているように見える」ことと「実際に徹底している」ことは異なります。そして評価基準が評価するのは後者です。

構造化されたレビュー業務でも同じ傾向が見られます。契約書をポリシーに照らして項目ごとに採点するタスクでは、Gemini 3.7 Flashは各項目の正しいスコアと合計点を算出しましたが、ベースラインモデルの集計は誤っていました。

業界別の結果

Gemini 3,7 Flash

最も大きな改善が見られたのは、定量的・手続き的な難易度が高い領域、すなわち金融サービス、消費財、法務、ヘルスケアでした。複数のステップが連鎖する業務では、初期の誤りが誤った結論へ波及するため、プロセス全体を慎重に推論できるAIモデルほど優位に立ちます。

  • 金融サービスでは最大の改善が見られ、Gemini 3.7は83%を達成しました。Gemini 3.6 Flashの65%に対して、18ポイントの向上です。 これは、デューデリジェンスやデータ分析など、分析負荷の高い業務におけるGemini 3.7の優れたパフォーマンスと一致しています。
  • 消費財では、85%という業界最高スコアを達成し、Gemini 3.6 Flashを14ポイント上回りました。 複雑なソース資料を横断して情報を統合し、結論を導き出す必要がある業務において、Gemini 3.7が強みを発揮することが結果から分かります。
  • 法務とヘルスケアでは、それぞれ12ポイント改善し、70%と64%に達しました。 これらの向上は、完全性、慎重なレビュー、根拠に基づく結論が求められる業務において、Gemini 3.7が優位であることを裏付けています。
  • 小売でも大幅な向上が見られ、Gemini 3.7は77%を記録し、Gemini 3.6 Flashの69%を上回りました。 これらの結果を総合すると、さまざまな企業・業界にわたって一貫した性能向上が実現していることが分かります。

速度も向上

精度の向上は、計算量の増加を伴いません。Gemini 3.7 Flashは平均約73秒でタスクを完了し、Gemini 3.6 Flashの115秒より約3分の1短い時間でした。使用するトークンとツール呼び出しもわずかに少なくなっています。より正確で、しかも実行負荷が軽いという組み合わせは、インタラクティブな業務や大量処理において重要です。

導入に向けた意味

ナレッジワーク向けのAIモデルを選ぶ部署にとって、Gemini 3.7 FlashはGemini 3.6 Flashから明確に進化しています。多段階の財務分析、デューデリジェンス、構造化レビューで優れた性能を発揮し、より速く回答を返します。重大な影響を伴う自由度の高い判断業務では、人によるレビューを組み合わせてください。速度と正確性の両方が求められる大量の分析業務では、より強力で効率的な選択肢となります。

Gemini 3.7 Flashは、近日中にBoxで利用可能になる予定です。

 関連コンテンツ

このブログは、Box, Inc. 公式ブログ(https://blog.box.com/)2026年8月13日付投稿の翻訳です。
著者: Sidharth Srinivasan, Product Manager, Box AI 
原文: https://blog.box.com/gemini-37-flash-real-enterprise-knowledge-work
わかる!エージェント型ワークフローで業務を自動化する方法

RECENT POST「AIリサーチ」の最新記事


AIリサーチ

テストすべきはAIモデルではなく、サンドボックスだった

AIリサーチ

エージェンティックガードレール: AIガバナンスの次なる段階は「制御」

AIリサーチ

AI活用のために始めるべきメタデータ整備

AIリサーチ

AIで勝つ企業、取り残される企業。企業向けAI最前線レポート