Promptfoo

プロンプト、Agent、RAGシステム、LLMアプリの評価とレッドチーミングを行うオープンソースのCLIおよびライブラリ

現在も活発に開発中:直近 90 日間のコミットは 920 件、最新コミットは 2026-10-02。

GitHub スター
2.6万
直近 30 日のスター増加
+1,110
直近 90 日のコミット
920
直近 6 か月のリリース
10

Promptfooは、LLMアプリケーションの評価とレッドチーミングのために設計された包括的なCLIおよびライブラリです。AIシステムの体系的なテストとセキュリティ評価という重要なニーズに対応し、チームが試行錯誤に頼るアプローチから、信頼性と安全性を備えたAI開発へ移行するのを支援します。OpenAI、Anthropic、Azure、Bedrock、Ollamaを含む複数のLLMプロバイダーにわたり、プロンプト、Agent、RAGシステムの自動評価をサポートします。基本的なテストに加え、promptfooはLLMアプリケーションの脆弱性スキャンとセキュリティ評価のための高度なレッドチーミング機能を提供します。モデルを並べて比較する機能を備え、チームがモデル選定と性能最適化について情報に基づいた判断を行うのを支援します。CI/CDパイプラインにシームレスに統合され、LLM関連のセキュリティおよびコンプライアンスの問題に対する自動チェックとプルリクエストレビューを可能にします。宣言的な設定方式とWebベースの結果ビューアーにより、promptfooではチーム間での検出結果の共有と、継続的な改善の追跡が容易になります。最近OpenAIに買収され、オープンソースのMITライセンスを維持しているこのツールは、18,000を超えるGitHubスターと活発なコミュニティの支援によって、その価値を実証しています。

他ツールとの違い

LangSmith(本番環境のオブザーバビリティ)やLangfuse(ログ記録)とは異なり、評価 + レッドチーミング + CI/CDコードスキャンを組み合わせた唯一のオープンソースツールであるpromptfoo — 現在はOpenAIの支援を受けつつ、全面的にMITライセンスを維持

主な機能

  • プロバイダーをまたいでモデルを並べて比較するLLM自動評価
  • LLMアプリケーションのセキュリティのためのレッドチーミングと脆弱性スキャン
  • プロンプトの自動リグレッションテストのためのCI/CD統合
  • PR内のLLM関連のセキュリティおよびコンプライアンスの問題を対象とするコードスキャン
  • アサーションに基づく採点を伴う評価結果を可視化するWeb UI
  • 100%ローカル実行 — プロンプトがマシンの外に出ることは一切なし

向いている用途

  • 自動レッドチーミングで、プロンプトインジェクションとジェイルブレイクに対するLLMアプリの耐性を強化するチーム
  • CI/CDパイプラインにLLM評価のリグレッションテストを追加するエンジニアリングチーム

向いていない用途

  • AI Agentの構築やデプロイ — Agent開発にはLangGraphまたはCrewAIを使用
  • 本番環境のリアルタイム監視 — オブザーバビリティにはLangSmithまたはLangfuseを使用

制限事項

  • 評価専用 — LLMアプリケーションのデプロイや提供は非対応
  • 複雑な評価設定にはYAMLの専門知識が必要
  • レッドチーミングの有効性は攻撃戦略の網羅性に依存

Promptfoo の代替ツール

  • ChainForge(3,033スター)
  • Langfuse:オブザーバビリティ、評価、プロンプトおよびデータセット管理のためのオープンソースLLMエンジニアリングプラットフォーム(3.5万スター)
  • phoenix:AIオブザーバビリティと評価(1.2万スター)
  • Agenta:プロンプトプレイグラウンド、プロンプト管理、LLM 評価、LLM オブザーバビリティを1か所に統合したオープンソースの LLMOps プラットフォームです。(4,804スター)
  • DeepEval:LLM評価フレームワーク(1.9万スター)
  • UpTrain(2,366スター)

代替ツールの詳しい比較(英語)→

よくある質問

Promptfoo とは?
Promptfooは、LLMアプリケーションの評価とレッドチーミングのために設計された包括的なCLIおよびライブラリです。AIシステムの体系的なテストとセキュリティ評価という重要なニーズに対応し、チームが試行錯誤に頼るアプローチから、信頼性と安全性を備えたAI開発へ移行するのを支援します。OpenAI、Anthropic、Azure、Bedrock、Ollamaを含む複数のLLMプロバイダーにわたり、プロンプト、Agent、RAGシステムの自動評価をサポートします。基本的なテストに加え、promptfooはLLMアプリケーションの脆弱性スキャンとセキュリティ評価のための高度なレッドチーミング機能を提供します。モデルを並べて比較する機能を備え、チームがモデル選定と性能最適化について情報に基づいた判断を行うのを支援します。CI/CDパイプラインにシームレスに統合され、LLM関連のセキュリティおよびコンプライアンスの問題に対する自動チェックとプルリクエストレビューを可能にします。宣言的な設定方式とWebベースの結果ビューアーにより、promptfooではチーム間での検出結果の共有と、継続的な改善の追跡が容易になります。最近OpenAIに買収され、オープンソースのMITライセンスを維持しているこのツールは、18,000を超えるGitHubスターと活発なコミュニティの支援によって、その価値を実証しています。
Promptfoo は現在もメンテナンスされていますか?
現在も活発に開発中:直近 90 日間のコミットは 920 件、最新コミットは 2026-10-02。
Promptfoo の代替ツールは?
Promptfoo に近いオープンソースの代替ツール:ChainForge、Langfuse、phoenix、Agenta、DeepEval、UpTrain。
Promptfoo はオープンソースですか?
はい。Promptfoo はオープンソースで、コードは GitHub で公開されています。

スター数・コミット・リリースのデータは GitHub API から毎日自動更新しています。紹介文は AI が英語から翻訳し、別のモデルで逆翻訳チェックを行っています。 リポジトリ:github.com/promptfoo/promptfoo

AI エージェントツールを開発していますか?

無料で掲載を申請できます。有料で審査を早めることもできます。

ツールを登録する →