ToolMage
登录

promptfoo

访问官网

promptfoo 是一個全面性的大型語言模型(LLM)測試與評估框架。它協助開發者和企業透過系統性測試、基準評估和AI驅動的紅隊演練,來比較提示詞品質、評估模型效能並增強AI安全性。它支援超過50家LLM供應商,包括本地模型,並提供對開發者友善的CLI,可無縫整合至開發工作流程中。

5.0
收录时间:
2025-08-03
价格类型:
免费增值
月流量:
160.6K
社交媒体:
|||

promptfoo 概览

promptfoo 是一款專業級工具,旨在協助開發者和企業建構安全、可靠且高效能的AI應用程式。它是一個用於評估、測試和提高提示詞品質以及各種大型語言模型(LLM)效能的綜合框架。promptfoo 受到27家財富500強公司和龐大的開源社群的信賴,提供了在部署前確保AI系統穩健和安全所需的工具。

promptfoo 的核心理念是實現系統性的比較和評估。使用者可以同時針對多個LLM測試不同的提示詞,並排分析輸出結果,並做出數據驅動的決策。這對於優化效能、降低成本以及為特定用例選擇最佳模型至關重要。此外,promptfoo 非常重視安全性,提供了AI驅動的紅隊演練等進階功能,以主動識別提示詞注入、資料外洩和生成有毒內容等漏洞。

如何使用 promptfoo

使用 promptfoo 非常簡單,專為開發者設計。整個過程通常涉及命令列介面(CLI)和一個簡單的YAML設定檔。

  1. 安裝與初始化: 透過執行像 npx promptfoo@latest init 這樣的單一指令開始。該指令會以互動方式在您的專案中設定一個設定檔(promptfooconfig.yaml)。
  2. 設定: 編輯 promptfooconfig.yaml 檔案。在這裡,您可以定義要測試的提示詞(使用 {{variable_name}} 這樣的變數進行動態輸入),指定LLM供應商(例如OpenAI、Anthropic、Google或透過Ollama的本地模型),並建立您的測試案例。
  3. 定義測試案例: 在YAML檔案的「tests」部分,您可以列出將用於測試提示詞的各種輸入(測試案例)。您還可以新增「斷言」(assertions),以自動檢查模型的輸出是否符合特定標準(例如,不包含某些片語、是有效的JSON格式,或通過基於LLM的評估標準)。
  4. 執行評估: 在終端機中執行指令 npx promptfoo@latest eval。promptfoo 將會使用每個測試案例,針對所有指定的供應商執行您的所有提示詞。
  5. 檢視結果: 評估完成後,執行 npx promptfoo@latest view 開啟一個基於Web的使用者介面。該介面以清晰的並排比較方式展示所有輸出,突顯哪些通過或未通過您的斷言,使分析結果和迭代變得容易。

promptfoo 的核心功能

  • 系統性評估: 在結構化的並排視圖中比較提示詞、模型和模型參數,以找到最佳設定。
  • AI驅動的紅隊演練: 自動產生並執行客製化攻擊,以發現提示詞注入、資料外洩、不安全的工具使用和有毒內容生成等漏洞。
  • 模型品質基準測試: 評估和比較超過50家LLM供應商的效能、成本和速度,包括OpenAI、Google、Anthropic以及像Llama這樣的本地模型。
  • 自動斷言和指標: 使用各種斷言類型定義通過/失敗標準,包括JavaScript表達式、Python程式碼,甚至基於LLM的檢查(評估標準)來自動評分輸出。
  • 開發者友善的工作流程: 一個強大的CLI,具有即時重新載入和快取等功能,以加速開發週期。它以安全為先,核心工具無需SDK或雲端依賴。
  • 靈活部署: 免費使用開源CLI,或選擇託管雲端或本地企業解決方案以獲得進階功能、協作和支援。

promptfoo 的使用案例

promptfoo 用途廣泛,可應用於各種場景:

  • 提示詞工程: 迭代優化提示詞,以從LLM獲得更準確、一致和理想的回應。
  • 模型選擇: 在您的特定資料上對不同模型(例如GPT-4o vs. Claude 3 Sonnet vs. Llama 3)進行基準測試,以選擇最具成本效益和效能的選項。
  • 回歸測試: 將 promptfoo 整合到您的CI/CD流程中,以確保對提示詞或底層模型的更新不會降低效能或引入新問題。
  • AI安全審計: 在AI應用程式被生產環境利用之前,主動測試其安全漏洞。
  • RAG系統品質保證: 透過測試生成答案的相關性和準確性,評估檢索增強生成(RAG)系統的品質。
  • 內容審核與安全: 確保您的AI應用程式遵守安全準則,不產生有害、有偏見或不當的內容。

promptfoo 的優勢特點

promptfoo 的主要優勢在於其專注於建構穩健和安全的AI。它超越了簡單的提示詞測試,形成了一個整體的品質和安全保證框架。它是開源的、高度靈活的,並在企業規模上經過了實戰檢驗。透過在本地執行而無需雲端依賴,它確保了您資料的隱私和安全。該工具使團隊能夠快速而自信地行動,因為他們知道自己的AI應用程式既有效又安全。

定價和計劃

promptfoo 採用 免費增值 模式。核心的命令列工具是開源的,完全免費使用。對於需要進階功能的團隊和企業,promptfoo 提供付費解決方案:

  • 開源版(免費): 包括CLI、所有評估功能、供應商整合和社群支援。
  • 企業版: 提供託管雲端或本地部署、進階紅隊演練功能、協作工具、專屬支援等。企業版定價可透過預約演示取得。

promptfoo 评论 (0)

登录后发表评论。

登录

暂无评论。

流量分析

最新流量情况

月访问量160.6K
平均访问时长0:50
每次访问页数1.81
跳出率44.4%

状态

下降-14.7%较上月
数据更新于 2026-06-15

月度流量趋势

  • 2025-9: 86.7K
  • 2026-1: 152.0K
  • 2026-2: 141.3K
  • 2026-3: 314.1K
  • 2026-4: 188.4K
  • 2026-5: 160.6K

地理位置

Top 5 国家/地区

  • 🇺🇸美國
    44.8%
  • 🇮🇳印度
    20.0%
  • 🇻🇳越南
    16.8%
  • 🇩🇪德國
    10.6%
  • 🇮🇩印尼
    7.9%

流量来源

来源类型百分比
直接访问
71.2%
外链引荐
28.7%
邮件
0.1%
合计
100%
直接访问71.2%
外链引荐28.7%
邮件0.1%

热门关键词

关键词每次点击费用
jailbreak prompts$0.00
prompt foo$6.24
promptfoo$3.80
promptfoo documentation$0.00
rlvr$2.59

promptfoo 的相關 YouTube 影片

promptfoo 替代方案

Bolt Foundry
免费增值

Bolt Foundry

Bolt Foundry為開發者提供開源工具,用於對大型語言模型(LLM)進行單元測試。它透過使用稱為「評分器」的結構化、可測試的提示,將提示工程轉變為一門科學的、數據驅動的過程。這確保了AI輸出的可靠性、一致性和可衡量性,是建構生產級應用的理想選擇。

機器學習
Visits 7.3KFavorites 161Likes 129
Prompto
免费

Prompto

Prompto 是一款免費、開源、基於瀏覽器的介面,用於與各種大型語言模型(LLM)進行互動。它利用 LangChain.js 直接連接到 OpenAI、Anthropic 等供應商以及透過 Ollama 連接的本地模型,提供模型比較競技場、提示詞範本和多 AI 對話等進階功能,同時透過本機儲存資料來優先保護使用者隱私。

模型比較
Visits 7.4KFavorites 200Likes 168
Lakera
免费增值

Lakera

Lakera 是一個 AI 原生安全平台,旨在保護生成式 AI 應用程式免受提示注入、資料外洩和合規性違規等威脅。它提供即時運行保護、由全球最大 AI 紅隊支援的持續威脅情報,以及透過單行程式碼即可輕鬆整合。Lakera 受到像 Dropbox 這樣的企業信賴,以超低延遲保護所有主流模型和語言的 AI 代理和應用程式。

API
Visits 313.1KFavorites 191Likes 160
ArtisMind
付费

ArtisMind

ArtisMind 是一個企業級 AI 提示工程平台,旨在利用數據驅動的多模型智能來構建、評分和完善 AI 提示。它提供科學的五階段工作流程,用於為各種 AI 模型創建生產就緒、安全且優化的提示,解決提示注入、幻覺和質量不一致等挑戰。

工具
Visits 8KFavorites 190Likes 186
promptstart
免费增值

promptstart

promptstart 是一個先進的AI提示工程平台,旨在幫助使用者為各種AI模型建立、管理和優化提示。它擁有龐大的預製提示庫、智慧提示建構器和AI驅動的優化器,可提升AI生成內容和程式碼的品質與效率。

程式碼助手
Visits 1.8MFavorites 116Likes 123

promptfoo 分类

promptfoo 标签

promptfoo 嵌入功能

复制这段嵌入代码,将徽章放到博客、文章或产品官网,并把读者直接引导到 ToolMage 详情页。

ToolMageFOLLOW US ON▲ 130