SupabaseがオープンソースのAIエージェント評価基盤「Evals」を公開

Supabaseは、AIエージェントがSupabaseを使って開発作業を行う性能を測るオープンソースの評価基盤「Supabase Evals(supabase/evals)」をApache-2.0で公開しました。
各評価は、データベースのスキーマ作成、Edge Functionのデバッグ、RLS(行レベルセキュリティ)ポリシーの修正など、実際のSupabaseタスクを対象に実行されます。
Claude Code、Codex、OpenCodeといったコーディングエージェントを、モックではなくコンテナ上の実環境で動かし、結果を採点します。
フレームワークは、ホスティングに近いSupabaseスタックとローカルCLIプロジェクトを起動し、MCPサーバーとCLIを実際に呼び出します。
採点はEVAL.tsにより、決定論的チェックとLLMによる審査を組み合わせ、失敗時は1回だけリトライ可能です。
評価結果は公開リーダーボード(supabase.com/evals)と内部の回帰テストに反映され、回帰シナリオは毎日更新されます。
記事では、上位モデルはスキルなしでも高い通過率を示し、課題として移行の書き方や認証検証、ドキュメント参照のばらつきが挙げられています。
なお、ローカル実行にはDockerデーモンやAPIキー、ポート54321〜54329の空きが必要です。

参照元:2026/08/01 「Supabase Releases Evals: an Open Source Benchmark That Scores Claude Code, Codex and OpenCode on Real Supabase Tasks」 https://www.marktechpost.com/2026/08/01/supabase-releases-evals-an-open-source-benchmark-that-scores-claude-code-codex-and-opencode-on-real-supabase-tasks/

この記事へのリアクション

このニュースをどう受け止めましたか?

Reader Reaction

このニュース、みなさんはどう感じましたか?ぜひコメント欄であなたの声を聞かせてください。

※本記事に掲載している情報は公開時点のものです。最新情報は公式発表等をご確認ください。

ぜひコメントを添えてシェアお願いします。
  • URLをコピーしました!
  • URLをコピーしました!

アンケート

悩み相談をするなら、どちらに打ち明けたいですか?

回答者数:2人 投票期間:2026/04/16〜2026/08/02
回答はお一人様1回までです。


PR:実務直結の稼げるAIスキルを学べる

DMM 生成AI CAMP

AIを使いこなす側か、使われる側か。今がキャリアの分岐点。

全コース学び放題
入会金・教材費0円
最低契約期間なし・いつでも解約OK

受講生同士が繋がれるコミュニティ

Google検索で 3min AI を優先表示できます

Google検索の「優先ソース」に追加すると、通信ニュースを検索した際に、3min AIの記事が見つけやすくなります。

※Googleの設定画面が開きます。表示されたサイトにチェックを入れると、優先ソースとして設定できます。

Google検索の優先ソースに追加する

コメント

コメントする

CAPTCHA


日本語が含まれない投稿は無視されますのでご注意ください。(スパム対策)

目次