ToolMage
登录

最好的 模型評估 AI 工具

發現最強大的 模型評估 AI 工具,包括 Labelbox、Langfuse、Scale AI、Encord、Braintrust、Surge AI、PromptLayer、Voxel51、16x Engineer、Datacurve,以及其他相關工具。

Lattice
付费

Lattice

Lattice 是一款專為工程師和技術負責人設計的私有化 AI 研究助理,旨在幫助他們做出基於證據的 AI 基礎設施決策。它在您的設備上本機運行,分析您的文件、供應商規格和定價資訊,以提供附有可驗證引用的建議,從而簡化複雜的研究工作。

決策
Visits 9.2KFavorites 104Likes 114
PromptsLabs
免费

PromptsLabs

PromptsLabs 是一個由社群驅動的提示詞庫,專為測試和評估新型大型語言模型(LLM)的性能而設計。它提供了一套標準化的、可複製貼上的提示詞及預期輸出,幫助開發者和研究人員在邏輯、推理和數學等任務上對模型進行基準測試。

提示工程
Visits 6.4KFavorites 96Likes 95
Datacurve
付费

Datacurve

Datacurve為訓練和評估先進的AI基礎模型提供高品質、複雜的程式編碼資料。該平台專注於SFT、RLHF和代理人工作流程追蹤等格式,利用一個擁有超過14000名工程師的遊戲化平台來生成前沿資料。其服務專為頂尖AI實驗室和企業設計,旨在透過卓越的資料品質、規模和速度,解鎖新的模型能力並提升性能。

資料生成
Visits 100.4KFavorites 95Likes 106
The Foundry AI
付费

The Foundry AI

The Foundry AI 是一個專為建構 AI 網路代理的開發者設計的平台。它提供了一個確定性的網路模擬器和先進的標註框架,用於在可重現的環境中測試、基準測試和偵錯代理,擺脫了真實網路不可預測性的困擾。

模型評估
Visits 8KFavorites 135Likes 124
nonfinito
免费增值

nonfinito

nonfinito 是一個用於評估和比較多模態AI模型的綜合平台。它使開發人員、研究人員和企業能夠在自訂提示上並排測試各種LLM,透過「通過/失敗」評級評估其性能,並分析原始輸出。創建公共或私人基準測試,為任何任務找到最佳模型。

模型管理
Visits 6.5KFavorites 165Likes 166
HoneyHive
免费增值

HoneyHive

HoneyHive 是一款面向使用 LLM 和 AI 智慧體的開發人員的一體化 AI 可觀測性與評估平台。它提供了一個統一的解決方案,用於建構、測試、偵錯和監控 AI 應用,涵蓋從初步實驗到企業級部署的全過程。該平台幫助團隊系統地衡量 AI 品質,深入了解智慧體互動,監控成本和延遲等效能指標,並協作管理提示詞和資料集等關鍵資產,確保自信地交付可靠的 AI 產品。

偵錯
Visits 31.6KFavorites 182Likes 197
Labelbox
免费增值

Labelbox

Labelbox 是一個全面的以數據為中心的人工智慧平台,即「數據工廠」,專為AI團隊設計。它提供整合的軟體、專家服務和人才市場,用於為包括大型語言模型(LLM)和多模態系統在內的先進AI模型創建、管理和評估高品質的訓練數據。

標註
Visits 1.1MFavorites 109Likes 114
Scale AI
付费

Scale AI

Scale AI 是一個全端式平台,透過提供高品質資料、模型評估和微調服務來加速人工智慧開發。它服務於頂尖的人工智慧實驗室、企業和政府機構,提供全面的資料引擎,用於 RLHF、資料標註和生成,以支援先進的生成式人工智慧和大型語言模型。

標註
Visits 631.1KFavorites 130Likes 143
Surge AI
付费

Surge AI

Surge AI 是一個頂尖的資料標註平台,提供精英級的人類智能,為先進的人工智慧(AI)和通用人工智慧(AGI)的開發提供動力。Surge AI 專注於為 RLHF、模型評估和自訂資料集創建提供高品質資料,與 OpenAI 和 Anthropic 等領先的 AI 實驗室合作,訓練、對齊和測試下一代模型。他們專注於建構真正智能係統所需的細微差別和複雜性。

MLOps
Visits 224.7KFavorites 149Likes 138
Voxel51
免费增值

Voxel51

Voxel51 提供企業級電腦視覺和多模態 AI 平台 FiftyOne。它使開發人員和資料科學家能夠管理、視覺化和評估複雜的資料集,從而建構更高性能的模型。透過專注於以資料為中心的 AI,FiftyOne 簡化了資料標註、品質改進和模型分析的工作流程,加速了整個開發生命週期。

MLOps
Visits 120.9KFavorites 132Likes 128
Teammately
免费增值

Teammately

Teammately 是一個專為AI工程師設計的高級AI代理平台。它能自動化並加速整個AI開發生命週期,從提示詞生成、RAG建構到多維度評估和生產環境可觀測性。用更少的時間,建構可靠、可擴展且安全的,難以出錯的AI應用。

MLOps
Visits 6.4KFavorites 141Likes 149
Autoblocks
免费增值

Autoblocks

Autoblocks 是一個面向 AI 開發團隊的綜合平台,用於測試、評估和發布安全、可靠的 AI 應用程式。它專為醫療、金融等高風險行業設計,簡化了開發人員與領域專家 (SME) 之間的協作,以加速可信賴的 AI 聊天機器人和智能體的部署。

安全
Visits 9.1KFavorites 134Likes 141
Braintrust
免费增值

Braintrust

Braintrust 是一個用於開發、評估和部署穩健的 LLM 應用程式的端對端平台。它為提示詞工程、模型評估、即時追蹤和生產監控提供了一套全面的工具。Braintrust 專為技術和非技術團隊成員設計,有助於簡化 AI 開發生命週期,確保 AI 產品可靠、有效並為生產做好準備。

評估與測試
Visits 234.3KFavorites 162Likes 167
16x Engineer
免费增值

16x Engineer

16x Engineer 是一個面向軟體和AI工程師的綜合平台,提供一套專業工具和深度資源。其特色產品包括用於AI輔助編程中高級上下文管理的「16x Prompt」,以及用於評估提示和模型的「16x Eval」。該平台由工程師為工程師打造,旨在透過實用工具和關於技術與職業發展的專家指南,提高生產力並加速職業成長。

AI
Visits 120.2KFavorites 132Likes 134
Prompt Mixer
免费

Prompt Mixer

Prompt Mixer 是一款強大的開源提示工程工具,為團隊提供了一個協作工作區。它支援使用者透過管理提示鏈、比較不同的大型語言模型(LLM)和利用進階評估指標,來創建、測試、評估和部署由 AI 驅動的解決方案。

提示工程
Visits 7.2KFavorites 138Likes 127
Magicflow AI
免费增值

Magicflow AI

Magicflow AI 是一個專為生成式 AI 圖像實驗設計的專業工作區。它能幫助用戶大規模測試提示詞、評估 Stable Diffusion 等模型並分析數千張圖像。該工具專為團隊和個人設計,透過有組織的、協作式的和數據驅動的測試,簡化了完善 AI 生成視覺效果的工作流程。

測試
Visits 6.8KFavorites 135Likes 133
Langtail
免费增值

Langtail

Langtail 是一個低程式碼平台,專為測試和偵錯由大型語言模型(LLM)驅動的AI應用程式而設計。它透過類似試算表的測試介面、用於阻擋惡意輸入的AI防火牆以及用於提示管理的協作工具,幫助團隊確保AI的可預測性和安全性。在使用者接觸到之前,捕捉錯誤並優化您的LLM輸出。

低程式碼無程式碼
Visits 13.8KFavorites 130Likes 118
remyx
免费增值

remyx

Remyx 是一個專為 AI 開發設計的 ExperimentOps(實驗維運)平台。它透過提供一個用於結構化、可複用和可追蹤實驗的協作工作室,幫助 AI 和產品團隊將知識操作化。透過專注於自訂指標和引導式學習循環,Remyx 加速了 AI 開發生命週期,確保 AI 系統與真實的業務目標和用戶影響保持一致。

實驗
Visits 7.9KFavorites 128Likes 141
PromptLayer
免费增值

PromptLayer

PromptLayer 是您用於 AI 工程的綜合工作臺,為提示詞管理、評估和 LLM 可觀測性提供統一平臺。它使團隊能夠對每個提示詞和代理進行版本控制、測試和監控,促進技術和非技術利害關係人之間的協作,從而高效地建構和擴展生產就緒的 AI 應用程式。

模型管理
Visits 218.5KFavorites 143Likes 131
Freeplay
免费增值

Freeplay

Freeplay 是一個企業級平台,專為 AI 團隊設計,用於建構、測試和持續改進 AI 產品及智慧體。它將提示管理、實驗、LLM 可觀測性和資料審查統一到單一工作流程中,為加速產品品質和開發速度創建了強大的資料飛輪。

分析
Visits 17KFavorites 109Likes 102
Encord
免费增值

Encord

Encord 是一個面向視覺和多模態人工智慧的綜合數據開發平台。它提供管理、整理和標註大規模非結構化數據(如圖像、影片和 DICOM 文件)的工具。該平台透過先進的標註、模型評估和人機協同工作流程,幫助人工智慧團隊建構高品質數據集,提高模型性能,並加速生產級人工智慧應用的部署。

標註
Visits 273.5KFavorites 150Likes 131
Laminar
免费增值

Laminar

Laminar 是一個專為建構可靠 AI 應用的開發者設計的開源可觀測性與評估平台。它提供全面的工具用於追蹤、評估和偵錯由 LLM 驅動的系統。核心功能包括即時追蹤、瀏覽器代理可觀測性、互動式實驗場和整合的資料集管理,從而簡化從開發到生產的整個 MLOps 生命週期。

偵錯
Visits 6.3KFavorites 139Likes 133
Langfuse
免费增值

Langfuse

Langfuse 是一個開源的 LLM 工程平台,為偵錯、評估和改進 LLM 應用提供全面的工具。它提供追蹤、提示詞管理、評估框架和指標等功能,為使用大型語言模型進行建構的團隊簡化整個開發生命週期。

分析
Visits 902.1KFavorites 126Likes 126
OverallGPT
免费增值

OverallGPT

OverallGPT 是一個創新平台,可讓您並排比較來自 GPT-4、Claude、Gemini 和 Llama 等領先 AI 模型的回复。它能幫助您了解它們獨特的優缺點,甚至能生成一個綜合了每個回复精華的「總體答案」,使您能夠做出更明智的決策並提高工作效率。

模型評估
Visits 19.9KFavorites 139Likes 143
標籤