ToolMage
登录

最好的 模型评估 AI 工具

发现最强大的 模型评估 AI 工具,包括 Labelbox、Langfuse、Scale AI、Encord、Braintrust、Surge AI、PromptLayer、Voxel51、16x Engineer、Datacurve,以及其他相关工具。

Lattice
付费

Lattice

Lattice 是一款专为工程师和技术负责人设计的私有化 AI 研究助理,旨在帮助他们做出基于证据的 AI 基础设施决策。它在您的设备上本地运行,分析您的文档、供应商规格和定价信息,以提供带有可验证引用的建议,从而简化复杂的研究工作。

决策
Visits 10.1KFavorites 117Likes 123
PromptsLabs
免费

PromptsLabs

PromptsLabs 是一个由社区驱动的提示词库,专为测试和评估新型大型语言模型(LLM)的性能而设计。它提供了一套标准化的、可复制粘贴的提示词及预期输出,帮助开发者和研究人员在逻辑、推理和数学等任务上对模型进行基准测试。

提示工程
Visits 7.3KFavorites 101Likes 100
Datacurve
付费

Datacurve

Datacurve为训练和评估先进的AI基础模型提供高质量、复杂的编码数据。该平台专注于SFT、RLHF和智能体工作流追踪等格式,利用一个拥有超过14000名工程师的游戏化平台来生成前沿数据。其服务专为顶尖AI实验室和企业设计,旨在通过卓越的数据质量、规模和速度,解锁新的模型能力并提升性能。

数据生成
Visits 101.4KFavorites 106Likes 116
The Foundry AI
付费

The Foundry AI

The Foundry AI 是一个专为构建 AI 网络代理的开发者设计的平台。它提供了一个确定性的网络模拟器和先进的标注框架,用于在可复现的环境中测试、基准测试和调试代理,摆脱了真实网络不可预测性的困扰。

模型评估
Visits 9KFavorites 144Likes 134
nonfinito
免费增值

nonfinito

nonfinito 是一个用于评估和比较多模态AI模型的综合平台。它使开发人员、研究人员和企业能够在自定义提示上并排测试各种LLM,通过“通过/失败”评级评估其性能,并分析原始输出。创建公共或私人基准测试,为任何任务找到最佳模型。

模型管理
Visits 7.3KFavorites 176Likes 171
HoneyHive
免费增值

HoneyHive

HoneyHive 是一款面向使用 LLM 和 AI 智能体的开发人员的一体化 AI 可观测性与评估平台。它提供了一个统一的解决方案,用于构建、测试、调试和监控 AI 应用,涵盖从初步实验到企业级部署的全过程。该平台帮助团队系统地衡量 AI 质量,深入了解智能体交互,监控成本和延迟等性能指标,并协作管理提示词和数据集等关键资产,确保自信地交付可靠的 AI 产品。

调试
Visits 32.5KFavorites 188Likes 206
Labelbox
免费增值

Labelbox

Labelbox 是一个全面的以数据为中心的人工智能平台,即“数据工厂”,专为AI团队设计。它提供集成的软件、专家服务和人才市场,用于为包括大型语言模型(LLM)和多模态系统在内的先进AI模型创建、管理和评估高质量的训练数据。

标注
Visits 1.1MFavorites 122Likes 124
Scale AI
付费

Scale AI

Scale AI 是一个全栈式平台,通过提供高质量数据、模型评估和微调服务来加速人工智能开发。它服务于顶尖的人工智能实验室、企业和政府机构,提供全面的数据引擎,用于 RLHF、数据标注和生成,以支持先进的生成式人工智能和大型语言模型。

标注
Visits 632KFavorites 138Likes 150
Surge AI
付费

Surge AI

Surge AI 是一个顶尖的数据标注平台,提供精英级的人类智能,为先进的人工智能(AI)和通用人工智能(AGI)的开发提供动力。Surge AI 专注于为 RLHF、模型评估和自定义数据集创建提供高质量数据,与 OpenAI 和 Anthropic 等领先的 AI 实验室合作,训练、对齐和测试下一代模型。他们专注于构建真正智能系统所需的细微差别和复杂性。

MLOps
Visits 225.6KFavorites 155Likes 141
Voxel51
免费增值

Voxel51

Voxel51 提供企业级计算机视觉和多模态 AI 平台 FiftyOne。它使开发人员和数据科学家能够管理、可视化和评估复杂的数据集,从而构建性能更高的模型。通过专注于以数据为中心的 AI,FiftyOne 简化了数据标注、质量改进和模型分析的工作流程,加速了整个开发生命周期。

MLOps
Visits 121.8KFavorites 144Likes 133
Teammately
免费增值

Teammately

Teammately 是一个专为AI工程师设计的高级AI代理平台。它能自动化并加速整个AI开发生命周期,从提示词生成、RAG构建到多维度评估和生产环境可观测性。用更少的时间,构建可靠、可扩展且安全的,难以出错的AI应用。

MLOps
Visits 7.3KFavorites 150Likes 159
Autoblocks
免费增值

Autoblocks

Autoblocks 是一个面向 AI 开发团队的综合平台,用于测试、评估和发布安全、可靠的 AI 应用程序。它专为医疗、金融等高风险行业设计,简化了开发人员与领域专家 (SME) 之间的协作,以加速可信赖的 AI 聊天机器人和智能体的部署。

安全
Visits 10KFavorites 141Likes 148
Braintrust
免费增值

Braintrust

Braintrust 是一个用于开发、评估和部署稳健的 LLM 应用程序的端到端平台。它为提示词工程、模型评估、实时追踪和生产监控提供了一套全面的工具。Braintrust 专为技术和非技术团队成员设计,有助于简化 AI 开发生命周期,确保 AI 产品可靠、有效并为生产做好准备。

评估与测试
Visits 235.1KFavorites 170Likes 176
16x Engineer
免费增值

16x Engineer

16x Engineer 是一个面向软件和AI工程师的综合平台,提供一套专业工具和深度资源。其特色产品包括用于AI辅助编程中高级上下文管理的“16x Prompt”,以及用于评估提示和模型的“16x Eval”。该平台由工程师为工程师打造,旨在通过实用工具和关于技术与职业发展的专家指南,提高生产力并加速职业成长。

AI
Visits 121KFavorites 134Likes 143
Prompt Mixer
免费

Prompt Mixer

Prompt Mixer 是一款强大的开源提示工程工具,为团队提供了一个协作工作区。它支持用户通过管理提示链、比较不同的大语言模型(LLM)和利用高级评估指标,来创建、测试、评估和部署由 AI 驱动的解决方案。

提示工程
Visits 8KFavorites 149Likes 135
Magicflow AI
免费增值

Magicflow AI

Magicflow AI 是一个专为生成式 AI 图像实验设计的专业工作区。它能帮助用户大规模测试提示词、评估 Stable Diffusion 等模型并分析数千张图像。该工具专为团队和个人设计,通过有组织的、协作式的和数据驱动的测试,简化了完善 AI 生成视觉效果的工作流程。

测试
Visits 7.6KFavorites 143Likes 143
Langtail
免费增值

Langtail

Langtail 是一个低代码平台,专为测试和调试由大型语言模型(LLM)驱动的AI应用程序而设计。它通过类似电子表格的测试界面、用于阻止恶意输入的AI防火墙以及用于提示管理的协作工具,帮助团队确保AI的可预测性和安全性。在用户接触到之前,捕捉错误并优化您的LLM输出。

低代码无代码
Visits 14.6KFavorites 144Likes 129
remyx
免费增值

remyx

Remyx 是一个专为 AI 开发设计的 ExperimentOps(实验运维)平台。它通过提供一个用于结构化、可复用和可追踪实验的协作工作室,帮助 AI 和产品团队将知识操作化。通过专注于自定义指标和引导式学习循环,Remyx 加速了 AI 开发生命周期,确保 AI 系统与真实的业务目标和用户影响保持一致。

实验
Visits 8.8KFavorites 139Likes 151
PromptLayer
免费增值

PromptLayer

PromptLayer 是您用于 AI 工程的综合工作台,为提示词管理、评估和 LLM 可观测性提供统一平台。它使团队能够对每个提示词和代理进行版本控制、测试和监控,促进技术和非技术利益相关者之间的协作,从而高效地构建和扩展生产就绪的 AI 应用程序。

模型管理
Visits 219.4KFavorites 159Likes 138
Freeplay
免费增值

Freeplay

Freeplay 是一个企业级平台,专为 AI 团队设计,用于构建、测试和持续改进 AI 产品及智能体。它将提示管理、实验、LLM 可观测性和数据审查统一到单个工作流中,为加速产品质量和开发速度创建了强大的数据飞轮。

分析
Visits 17.8KFavorites 117Likes 114
Encord
免费增值

Encord

Encord 是一个面向视觉和多模态人工智能的综合数据开发平台。它提供管理、整理和标注大规模非结构化数据(如图像、视频和 DICOM 文件)的工具。该平台通过先进的标注、模型评估和人机协同工作流,帮助人工智能团队构建高质量数据集,提高模型性能,并加速生产级人工智能应用的部署。

标注
Visits 274.3KFavorites 158Likes 140
Laminar
免费增值

Laminar

Laminar 是一个专为构建可靠 AI 应用的开发者设计的开源可观测性与评估平台。它提供全面的工具用于追踪、评估和调试由 LLM 驱动的系统。核心功能包括实时追踪、浏览器代理可观测性、交互式实验场和集成的数据集管理,从而简化从开发到生产的整个 MLOps 生命周期。

调试
Visits 7.2KFavorites 142Likes 143
Langfuse
免费增值

Langfuse

Langfuse 是一个开源的 LLM 工程平台,为调试、评估和改进 LLM 应用提供全面的工具。它提供追踪、提示词管理、评估框架和指标等功能,为使用大语言模型进行构建的团队简化整个开发生命周期。

分析
Visits 902.9KFavorites 133Likes 131
OverallGPT
免费增值

OverallGPT

OverallGPT 是一个创新平台,可让您并排比较来自 GPT-4、Claude、Gemini 和 Llama 等领先 AI 模型的回复。它能帮助您了解它们独特的优缺点,甚至能生成一个综合了每个回复精华的“总体答案”,使您能够做出更明智的决策并提高工作效率。

模型评估
Visits 20.8KFavorites 146Likes 147
标签