「AIエージェント」という言葉は、さまざまなスプレッドシートツールで使われています。数式を書くエージェントもいれば、ワークブック内で作業するもの、アップロードされたファイルを分析するもの、複数のエクスポートをレポートやダッシュボードに変えるものもあります。
これらは有用な機能ですが、漠然としたランキングで評価すべきではありません。あなたのチームは、エージェントが何にアクセスできるか、何を変更するか、その作業がどのようにレビューされるか、最終的な出力が次のビジネス上の意思決定に適合するかを知る必要があります。
このバージョンのガイドには、7つすべてのエージェントカテゴリの記録されたインターフェース証拠、目に見えるダーティデータの前後テスト、3つの観察された障害ケース、10秒のワークフロークリップ、ダウンロード可能なテストワークブックが含まれています。また、ギャップも公開されています。この記事では、Copilot、Gemini、ChatGPTを同じテスト環境で独立して実行していないため、ベンダー間の速度や精度のランキングは主張していません。
重要なポイント:
- ワークブック自体が成果物となる場合はワークブックネイティブエージェントを使用し、ジョブが複数のエクスポートから始まり、レビュー済みのレポートやダッシュボードで終わる場合はファイルからレポートへのエージェントを使用する。
- 信頼できるエージェントテストには、既知の重複、混合フォーマットの日付、欠落キー、曖昧なラベル、独立して計算された管理合計が含まれる。合格とは、合計が一致するだけでなく、例外も表面化することを意味する。
- 記載されたファイルサイズ制限はパフォーマンス結果ではない。50MBのCSVについては、パースの成功、行数の照合、最初の利用可能な出力までの時間、同じプロンプトが2回目の実行で同じグループ集計を返すかどうかを測定する。
- RowSpeakはファイルベースの分析とレポート作成向けに設計されている。Microsoft CopilotとGeminiは、作業をExcelやSheets内にとどめておく必要がある場合に自然である。BIは、ライブ更新とガバナンスされたメトリクスが支配的な場合に強い宛先となる。
- 観察されたRowSpeakの実行では、有用な出力と実際の弱点が見られた。混合日付タイプは1回のクリーニングパスの後も残り、監査の回答は説明されていない
53,250の残余について推測し、生成されたワークブックにはまだ修復が必要なグラフが含まれていた。
スプレッドシートAIエージェントとは何か?
このガイドでは、スプレッドシートAIエージェントは、指示から出力へと複数ステップのスプレッドシートタスクを実行できるツールを指します。列を検査したり、変換を提案したり、数式を生成したり、グラフを作成したり、説明をドラフトしたり、レポートを作成したりできます。
これは承認の必要性をなくすものではありません。エージェントはカテゴリマッピングや数式を提案できますが、レポートの責任者は定義と結果に対して引き続き責任を持ちます。
このガイドの証拠とテスト範囲
このガイドは、AIツールリストでよく混同される3種類の証拠を分けています。
- 観察された製品ワークフロー: 以下のRowSpeakのスクリーンショットは、このサイトリポジトリ内の記録された製品デモからのものです。実際のプロンプト、出力、ダウンロード可能な成果物、目に見える欠陥を示しています。一部の録画では以前のExcelmaticという名前を使用しています。Excelmaticは現在RowSpeakです。そのため、ブランドラベルは歴史的なものですが、ワークフローの証拠は引き続き有効です。
- ベンダーが文書化した機能: Microsoft Copilot、Gemini、ChatGPTに関する記述は、カテゴリレベルでの製品表面を説明しています。実際のハンズオン結果として提示されているわけではありません。可用性、プランルール、ファイル制限は変更される可能性があるため、購入前に最新のベンダー文書を確認してください。
- 評価方法: 以下の5MB、25MB、50MBのテストは再現可能なプロトコルであり、公開されたベンダー間ベンチマーク結果ではありません。すべてのベンダーを同じハードウェアとアカウント層で計時していないため、この記事はRowSpeakがCopilotや他の製品より速いと主張するものではありません。
この境界は重要です。洗練されたデモはワークフローが存在することを証明しますが、すべてのワークブック、数式チェーン、大規模なCSVが同じように動作することを証明するものではありません。
ExcelとGoogle SheetsのAIエージェント7種類
1. 数式エージェント
最適な用途: 平易な英語のリクエストを開始用の数式に変換したり、既存の数式を説明したりする。
ユーザーがワークブック内で結果をテストする場合に使用します。ルックアップロジック、日付計算、条件付き数式、数式の説明に役立ちます。完全なレポート作成ワークフローの代わりにはなりません。
以下に記録された数式エージェントの出力は、$1,000以上の売上、日付より前の売上、「transfer」を含む説明など、いくつかのSUMIFSの例を示しています。

観察された制限: 数式はセルに挿入されるのではなく、レンダリングされたテキストとして表示されており、スクリーンショットはソース範囲に対する独立した再計算を示していません。また、日付条件は、ロケールと10月3日を含むかどうかで結果が変わる可能性があるため、精査が必要です。Excelが期待される管理合計を返すまで、これら数式は候補として扱ってください。
2. ワークブックネイティブアシスタント
最適な用途: ExcelやGoogle Sheets内にとどまりながら支援を必要とするチーム。
これらのエージェントは、ワークブックやシートが主要な操作画面である場合に自然な選択肢となります。本番ワークブックの編集をアシスタントに許可する前に、権限、テナント設定、機能の可用性、変更履歴を確認してください。
この記事では、Microsoft CopilotやGeminiをテスト環境で実行していません。観察されたワークブック出力の証拠に最も近いのは、60サンプル行・6ヶ月を要求するプロンプトから4シートのExcelファイル(Raw_Data、KPI_Definitions、Pivot_Summary、Dashboard)を生成したRowSpeakの実行です。

不完全だからこそ、このスクリーンショットは有用です。ワークブックとシートは存在し、一部のグラフにはデータが含まれていますが、いくつかのグラフ領域はプレビューで空または不十分に表示されています。ワークブック出力エージェントは、ファイルが開かれた時点で完了ではありません。レビュー担当者は再計算し、グラフのソース範囲を検査し、フィルターをテストし、数式がエクスポート後も生き残ったことを確認する必要があります。
3. ファイルクリーニングエージェント
最適な用途: エクスポート間での一貫性のないラベル、空白フィールド、重複レコード、ミスマッチした構造を修正する。
エージェントにソース値を静かに上書きさせるのではなく、レビューテーブルを使用してください。North-East、Northeast、NEに対する提案されたマッピングは、オーナーが承認する必要があります。
この実際のクリーニングシーケンスは、8つの表示可能な非空白レコード、重複注文ID、3つの日付表現、空白の価格、一貫性のない顧客名の大文字小文字、空白のステータスから始まりました。最初に返されたテーブルは、重複除去後に6つの表示可能なレコードを示していますが、日付はまだテキストとExcelシリアル番号が混在しています。

これは実際のマルチステップ障害パターンです。1つのパスである次元を改善しますが、別の次元は未解決のままにします。2番目のプロンプトで日付と顧客名の大文字小文字を標準化できますが、表示される出力を再度チェックして、重複の再発や欠損値の処理を確認する必要があります。
次の記録されたRowSpeakの実行では、Registry.xlsxとプロンプト「テーブル内のデータをクリーニングし、データ形式を標準化し、欠損値をN/Aで埋めてください(セルを赤でハイライト))」を使用しました。

結果には、試行した変換が記載され、クリーニングされたワークブックがダウンロード可能です。

この証拠が示すもの: 製品がワークブック固有の指示を受け入れ、変換を説明し、成果物を返したこと。示していないもの: すべての日付と電話番号が正しくマッピングされたか、正当な空白を空白のままにすべきだったか、同じワークフローが50MBのCSVでどう機能するか。レビュー担当者は、クリーンファイルを受け入れる前に、異なる値の数、空白の数、行数、およびサンプリングされた5つのレコードを比較する必要があります。
4. 分析エージェント
最適な用途: クリーンまたはチェック済みテーブルについて質問し、期間を比較し、例外を見つけ、説明をドラフトする。
これらのエージェントは探索的作業に役立ちます。結論を受け入れる前に、グループ化された値、期間、レビューが必要な例外を表示するよう依頼してください。
記録された分析実行では、プロンプトがRowSpeakに101件の学生レコードを並べ替え、平均スコアを計算し、プレビュー用の全データを返すよう要求しています。


出力は平均49.85、標準偏差29.1を報告していますが、スクリーンショットは標準偏差の計算方法を開示しておらず、値を独立して再計算していません。「おおよそ中程度」は解釈であり、組織がスコアバンドを定義していない限り、計算された事実ではありません。
5. グラフ・ダッシュボードエージェント
最適な用途: 検証済みのメトリクスから視覚的なサマリーに移行する。
エージェントには、ビジネス上の質問と想定読者を伝えるべきです。グラフは、集計、フィルター、ラベル、解釈を誰かがチェックするまで完了しません。

表示されている4つのバーは合計11,240(3,650 + 5,700 + 440 + 1,450)になります。視覚要素自体は、報告期間、通貨、除外項目、ソースの照合を示していません。そのため、11,240は表示されたグラフの合計であり、承認された売上KPIではありません。
6. 監査・レビューエージェント
最適な用途: 可能性のある数式の不整合、欠落フィールド、異常値、レポートバージョン間の変更を特定する。
監査エージェントはレビューキューを作成します。取引やワークブックが「間違っている」という未レビューの主張をすべきではありません。

この実行は具体的な不一致を表面化しています。表示されている収益500,000、COGS180,000、営業経費125,000は195,000を示唆するのに対し、ワークブックは141,750と報告しています。残余は53,250です。回答はギャップに気づくという点で有用ですが、ソース証拠なしに「その他の控除」を示唆することで信頼性を弱めています。正しい監査ステータスは未照合 - ソース数式と隠れた依存関係を検査です。
7. ファイルからレポートへのエージェント
最適な用途: Excel、CSV、PDF、スクリーンショット、エクスポートデータから始めて、レポート、ダッシュボード、管理サマリーを必要とするチーム。
RowSpeakはこのカテゴリに当てはまります。これにより、チームは乱雑なビジネスファイルを回答、レポート、ダッシュボードに変え、最初のパスに洗練が必要な場合にワークフローを修正する余地があります。

ダッシュボードは共有可能なレビュー画面を提供しますが、スクリーンショットだけでは、売上1.31M、注文43、平均注文金額30.36Kが意図された粒度とフィルターを使用しているかどうかを検証できません。ファイルからレポートへのエージェントでも、ナラティブとは別に管理合計とメトリクス定義が必要です。
観察された実行台帳
これは記録された実行から実際に入手可能な証拠です。「未取得」は有利なスコアに変換せずに表示されたままにしています。
| エージェントカテゴリ | 観察されたテスト環境またはタスク | 具体的な可視出力 | 障害または未解決チェック | 証拠判定 |
|---|---|---|---|---|
| 数式 | 5つのSUMIFSシナリオ | 数式、計算値、説明 | ソース範囲の再計算なし。日付セマンティクスのレビューが必要 | 部分合格 |
| ワークブック出力 | プロンプトが60行、6ヶ月、4シートを指定 | .xlsxファイル(Raw_Data、KPI_Definitions、Pivot_Summary、Dashboard) |
いくつかのグラフ領域が空または不完全に見える | 成果物作成:成功。表示:不合格 |
| ファイルクリーニング | 8つの表示可能なソースレコード(重複ID、混合日付、空白、大文字小文字不一致) | 重複除去後6行。後で標準化/埋め戻し出力 | 最初のパスで混合日付タイプが残る。後のパスで回帰をチェックする必要あり | 部分合格 |
| 分析 | 101件の学生レコード | 平均49.85、SD29.1、ランキング、ナラティブ、ダウンロード可能なワークブック |
数式の慣例と独立した再計算が未取得 | 結果観察:精度未確認 |
| グラフ | 4つの製品カテゴリ | バーラベル3,650、5,700、440、1,450。表示合計11,240 |
期間、通貨、フィルター、ソース合計がない | 表示パス:KPI未確認 |
| 監査 | 純利益数式チェーン | 目に見える53,250の残余を検出 |
証拠なしに「その他の控除」を示唆 | 不一致パス:説明不合格 |
| ファイル→レポート | 売上ワークブックからダッシュボードへ | フィルター、5つのKPIカード、グラフ、書かれた洞察 | KPIの粒度とソース照合が未取得 | 成果物パス:メトリクス承認保留中 |
これらの録画では、アップロード時間、モデルトークン使用量、大規模コーパスにおける数式エラー率、50MB処理結果は取得されませんでした。これらの項目はテスト未実施であり、ゼロではありません。
スプレッドシートAIエージェントが2026年でも失敗する領域
障害1:あるクリーニングステップが別のステップを後退させる
ダーティデータシーケンスは、「正常にクリーニングされました」だけでは十分なステータスではない理由を示しています。重複除去により6つの表示可能な行が生成されましたが、日付セルはまだ文字列とExcelシリアル値が混在していました。後の標準化スクリーンショットではよりクリーンな日付と大文字小文字が示されていますが、変換が以前に重複除去された成果物に対して機能したことが証明されていないため、重複IDが再び見えています。
管理策: すべての変換の後(最後だけでなく)、行数、重複キー数、列ごとのヌル数、異なるカテゴリ数、変更セルサンプルについて、前後台帳を要求する。
障害2:監査エージェントはギャップを見つけ、橋をでっち上げることができる
数式監査の実行は53,250の残余を正しく露呈させた後、それが「その他の控除」を表すと推測しています。これはもっともらしい会計ストーリーですが、もっともらしさは証拠ではありません。
管理策: 監査出力を照合済み、未照合、ソース依存関係が必要の3つのラベルに強制する。正確なソースセルまたは行が指定されない限り、因果テキストを防止する。
障害3:生成されたワークブックが開いても、まだ未完成である
4シートのワークブックは成果物の作成成功を示していますが、ダッシュボードプレビューにはデータがほとんどまたはまったくないグラフ領域が含まれています。単に.xlsxのダウンロードが存在するという理由だけで、そのファイルがリーダーシップに提供できる状態であるわけではありません。
管理策: ワークブックを再度開いて再計算し、数式エラーを検査し、グラフのソース範囲をトレースし、フィルターをテストし、承認前にすべての出力シートをレンダリングする。
4つの一般的なワークフロー
| チームとジョブ | 最適なエージェントタイプ | 必要なレビュー |
|---|---|---|
| FP&A:月次実績対予算レポート | ファイル→レポート + 監査 | メトリクス定義、勘定マッピング、重要な差異 |
| 営業オペレーション:週次パイプラインレビュー | 分析 + ダッシュボード | ステージ定義、欠落オーナー、停滞案件ルール |
| Eコマース:在庫と返品レビュー | ファイルクリーニング + 分析 | SKUマッピング、需要期間、返品分類 |
| マーケティング:Google Sheetsキャンペーントラッカー | ワークブックネイティブ + 数式 | ソースマッピング、アトリビューションルール、計算フィールド |
エージェントの選択はワークフローに従うべきです。数式エージェントはマーケティングトラッカーには完璧かもしれませんが、月次財務パッケージには不十分でしょう。
弱いエージェントを素早く露呈させるコーナーケース
最も明らかなテスト行はクリーンな行ではありません。これらのケースをファイルの安全なコピーに追加してください。
| コーナーケース | 弱い結果 | レビュー可能な結果 |
|---|---|---|
01/02/2026が2026-02-01の隣に現れる |
黙って一方のロケールを選ぶ | 曖昧さをフラグし、日付の慣例を尋ねる |
NE、Northeast、North Eastが一緒に出現 |
すべての値を自動的にマージする | マッピングを提案し、元の値を保存する |
| 1つの注文が重複しているが、異なるステータスを持つ | 1行を削除する | 重複レビューテーブルに両方の行を返す |
| 小計行が取引データの中にある | 小計を別の取引としてカウントする | 混合粒度を検出するか、質問する |
N/Aがある列で「該当なし」、別の列で「欠落」を意味する |
両方をヌルとして扱う | 列固有のルールを使用する |
| 数式が隠しシートを参照している | 可視セルのみを説明する | 未解決の依存関係を名前指定するか、アクセスを要求する |
| 50MBのCSVが途中で切れた行で終わる | もっともらしい合計を生成する | 分析前に行数と管理合計を照合する |
これらのケースは評価をより乱雑にしますが、レポートの責任者が実際に承認しなければならない作業を反映しています。
一般的なチェックリストではなく、実用的な購入者テスト
評価を3つのパスで実行します。
パス1:小規模なテスト環境での正確性。 5つのシードされた問題とExcelで計算された管理合計を含む200~500行の匿名化データを使用します。どの問題が見つかったか、見逃されたか、合計が照合されたかを記録します。
パス2:次期ファイルでの再現性。 1つの列名を変更し、新しいカテゴリを導入し、1つのオプションフィールドを削除します。有用なエージェントは、文書化されたマッピングを保持するか、停止して明確化を求めるべきです。黙ったままの再マッピングは、定期的なレポート作成では不合格です。
パス3:運用スケール。 実際のエクスポートが50MBに達する場合は、同じアカウント層とネットワーク条件下で5MB、25MB、50MBのバージョンをテストします。アップロードの成功、パース時間、行数、管理合計、応答時間、出力サイズ、レビュー担当者の修正を記録します。データパスが同一でない場合、RowSpeakのアップロードテストとCopilotのワークブックテストを比較しないでください。
ダーティデータテストワークブックをダウンロード
クリーニングスクリーンショットに示されている同じ小規模テスト環境を使用してください:Sales_Data_Cleaning_Test.xlsxをダウンロード。これには、重複注文ID、混合日付形式、一貫性のない顧客名の大文字小文字、空白値、空白行が含まれています。エージェントに送信する前に、期待される行数と例外数を計算してください。
以下の10秒クリップは、記録されたプロンプトからクリーニング済み成果物へのワークフローを示しています。これはインタラクションのデモであり、タイミングベンチマークではありません。録画は編集されている可能性があり、サーバー処理時間を分離していません。
この評価スコアカードをExcelまたはSheetsにコピー
重み付けスコアの前にハードゲートを使用します。インポートされた行が照合されない、重要な管理合計が間違っている、または出力が黙って拒否された行をドロップする場合、エージェントはテスト不合格です。
| 基準 | 重み | スコアルール(0~5) | 必要な証拠 |
|---|---|---|---|
| インポート整合性 | ゲート | 行/列数が照合された場合のみ5。それ以外は不合格 |
インポートサマリーと拒否行数 |
| 重要な管理合計 | ゲート | 合意されたすべての合計が一致した場合のみ5。それ以外は不合格 |
独立したExcel計算 |
| シードされた問題の再現 | 20% | 見つかった問題 ÷ シードされた問題 | ソース行を含む例外テーブル |
| 偽陽性コントロール | 10% | 5=有効なレコードが誤って変更されなかった |
レビュー担当者の処分ログ |
| 数値的正確性 | 25% | 正しいグループメトリクスと数式 | 計算フィールド、フィルター、期間 |
| 再現性 | 15% | 2回目の実行と列名変更環境で同じ結果 | 実行ID、プロンプト、出力比較 |
| レビュー容易性と来歴 | 20% | 値が行、フィールド、数式、成果物にトレース可能 | ソース参照と未解決リスト |
| 出力のユーザビリティ | 10% | 軽微な修正または修正なしでワークブック/レポートを使用可能 | 修正数と承認メモ |
両方のゲートが合格を確認した後、100点結果をSUMPRODUCT(スコア, 重み) / 5として計算します。スコアの横に、見逃し、不合格、「テスト未実施」の項目を公開します。管理合計が不合格で高いスコアがあっても、依然として不合格の評価です。
機密性の高い財務、給与、法務、従業員レベルのデータの場合、エージェントをテストするためだけに生の個人データを使用しないでください。可能な限り匿名化データを使用し、管理されたデータ境界を必要とするワークフローについてはプライベートデプロイメントを評価してください。
汎用AI、ワークブックアシスタント、RowSpeak
以下の製品は、単一の「AI品質」スコアではなく、操作画面と成果物によって比較されるべきです。
| オプション | エージェントが動作する場所 | 最も適した用途 | レビュー画面 | この記事の証拠 | テストすべき重要な境界 |
|---|---|---|---|---|---|
| ExcelのMicrosoft Copilot | Microsoft 365ワークブック内 | 数式ヘルプ、ワークブック分析、編集(Excelが成果物の場合) | ワークブック数式、テーブル、変更コンテキスト | ベンダー文書のみ。独立実行なし | テナント/プラン可用性、ワークブック構造、外部ファイルパッケージでの動作 |
| Google SheetsのGemini | Google Workspaceワークフロー内 | 共同シート作業、テーブル作成、数式、サマリー、Workspaceコンテキスト | シートセル、バージョン履歴、共有レビュー | ベンダー文書のみ。独立実行なし | 機能可用性、最終ビジネスレポートがSheetsを離れる必要があるかどうか |
| ChatGPTデータ分析 | ファイルアップロード付き汎用チャット | 高速探索、コード支援分析、プロトタイプ | 会話、生成テーブル、コード、ダウンロード可能な成果物 | ベンダー文書のみ。独立実行なし | 再現性、ファイル保持ポリシー、ガバナンスされたレポートプロセスへの引き継ぎ |
| RowSpeak | ファイルベースの分析・レポート作成ワークスペース | 回答、レポート、ダッシュボードを必要とするExcel/CSV/PDF/画像入力 | プロンプト、表示分析、ダウンロード可能な成果物、レポート/ダッシュボード出力 | 7つの記録されたワークフローカテゴリ、3つの可視障害ケース | マッピング変更、曖昧な定義、大規模ファイル動作、レビュー担当者修正フロー |
| BIプラットフォーム | ビジネスシステムに接続されたガバナンスモデル | 共有メトリクス、スケジュール更新、権限、広範なダッシュボード配布 | セマンティックモデル、更新ログ、系列、ダッシュボード権限 | カテゴリ比較のみ。プラットフォームベンチマークなし | 実装労力、小規模なエクスポート駆動ワークフローがモデルを正当化するかどうか |
RowSpeakは、ワークブック支援とBIの間のビジネスニーズがある場合に有用です。チームはエクスポートされたファイルを持ち、再現可能な分析・レポート作成ワークフローを必要とし、同僚がレビューして共有できる出力を必要とします。一般的なファイル作業についてはスプレッドシートアシスタントワークフローを、レポート作成に焦点を当てた比較についてはビジネスレポート作成エージェントガイドをご覧ください。
現在の機能の詳細については、まずベンダー自身の文書をご確認ください。ExcelのMicrosoft Copilot、Google SheetsのGemini、ChatGPTファイルアップロードFAQ。ベンダーページは可用性と制限を説明しています。独立したパフォーマンスベンチマークではありません。

管理された最初のテストを実行する
まず上記のダウンロード可能なテスト環境から始め、エージェントを実行する前に期待される結果を書き留めてください。
- 8つの非空白ソースレコード
- 2つの完全重複ペア(
1001と1002)。完全重複を除去すると一意の行は6つ - 日付はドットテキスト、スラッシュ形式テキスト、日付のような値で表現
- 注文
1003と1005の価格が欠落 - 注文
1003と1006のステータスが欠落 - 顧客名の大文字小文字が不統一
- 取引になるべきではない空白行が1つ
次のプロンプトを使用します:
このワークブックを変更する前にプロファイルしてください。ソース行数、完全重複グループ、日付表現、列ごとの欠落カウントを返してください。次に、完全重複行を除去し、日付をyyyy-mm-ddに標準化し、顧客名を一貫して標準化し、欠損値は明示的に承認されたルールがない限り保持した新しいワークブックを作成してください。ソース行、フィールド、古い値、新しい値、ルールをリストしたChangesシートを含めてください。出力行数をソースと照合してください。
エージェントが欠落価格をゼロに変更したり、注文IDのみが共有され同一でない行を削除したり、ロケールを宣言せずに曖昧な日付を変換したり、変更ログを省略した場合は、実行を不合格にします。その後、同じプロンプトを2回実行し、行数、マッピング、変更セル、管理合計を比較します。
小規模テスト環境が合格した後にのみ、5MB、25MB、50MBのバリエーションを作成してください。この記事では、これらの大規模ファイルのベンダー間結果はテスト未実施のままです。この制限を公開することは、Copilot対RowSpeakの応答時間表をでっち上げるよりも信頼性があります。
有用なAIエージェントとは、すべてをできると主張するものではありません。それは、あなたのスプレッドシートプロセスの適切な部分を、あなたのチームが信頼できる境界内で完了するものです。
ファイルからレポートへのカテゴリを評価したい場合は、上記のテスト環境とスコアカードを、サニタイズされたエクスポートでRowSpeakスプレッドシートアシスタントワークフローに実行してください。プロンプト、出力、例外ログ、レビュー担当者の判断を一緒に保持し、ワークフローが本番に達する前に結果を監査できるようにしてください。







