ToolMage
로그인

Best LLM 평가 AI tools

Discover powerful LLM 평가 AI tools, including AfterQuery, promptfoo, Evidently AI, Ragas, getmaxim, Confident AI, deepchecks, Adaline, Giskard 및 Agenta, and other related products.

Freemium

Plurai

Plurai는 시뮬레이션, 평가, 가드레일을 통해 프로덕션 수준의 에이전트 개발을 가속화하는 AI 에이전트 신뢰 플랫폼입니다. 대규모 언어 모델에 비해 실패율, 정책 위반, 비용을 크게 줄여줍니다.

플랫폼
Visits 10.2KFavorites 3Likes 5
Freemium

Agenta

Agenta는 팀이 신뢰할 수 있는 LLM 애플리케이션을 구축할 수 있도록 설계된 오픈 소스 LLMOps 플랫폼입니다. 프롬프트 관리, 체계적인 평가 및 관찰 가능성을 단일 협업 워크플로우에 통합하여 개발자, 제품 관리자 및 도메인 전문가가 분산된 프로세스에서 구조화된 개발로 전환할 수 있도록 지원합니다.

디버깅
Visits 37.3KFavorites 105Likes 113
Freemium

Athina

Athina는 팀이 LLM 애플리케이션을 10배 더 빠르게 구축, 테스트 및 모니터링할 수 있도록 설계된 협업 AI 개발 플랫폼입니다. 프롬프트 엔지니어링, 평가, 실험, 주석 및 프로덕션 모니터링을 위한 포괄적인 도구 모음을 제공합니다. Athina는 기술 및 비기술 사용자 모두를 지원하여 원활한 협업과 고품질의 신뢰할 수 있는 AI 시스템 배포를 보장합니다.

주석
Visits 10.2KFavorites 84Likes 78
Freemium

LangWatch

LangWatch는 LLM 애플리케이션을 모니터링, 평가 및 최적화하기 위한 올인원 오픈소스 플랫폼입니다. 시뮬레이션된 사용자 환경을 통한 AI 에이전트 테스트에 특화되어 있어 팀이 프로덕션 전에 리그레션 및 엣지 케이스를 포착할 수 있도록 돕습니다. 이 플랫폼은 관찰 가능성, 평가, 최적화 및 가드레일을 결합하여 AI 애플리케이션의 신뢰성, 보안 및 성능을 보장합니다.

디버깅
Visits 26.7KFavorites 113Likes 114
Freemium

deepchecks

Deepchecks는 LLM 기반 애플리케이션을 평가, 검증 및 모니터링하기 위한 엔드투엔드 플랫폼입니다. AI 팀이 AI 진행 상황을 정의, 측정 및 검증하여 개발부터 CI/CD, 프로덕션에 이르기까지 테스트를 간소화함으로써 고품질의 신뢰할 수 있는 애플리케이션을 출시할 수 있도록 지원합니다.

분석
Visits 82.1KFavorites 124Likes 116
Paid

EvalsOne

EvalsOne은 생성형 AI 애플리케이션을 위해 설계된 올인원 평가 플랫폼입니다. 강력하고 직관적인 인터페이스를 통해 팀이 LLM 프롬프트, RAG 파이프라인, AI 에이전트를 손쉽게 평가, 반복 및 최적화하여 강력하고 경쟁력 있는 AI 제품을 보장할 수 있도록 지원합니다.

모델 관리
Visits 4KFavorites 95Likes 94
Freemium

Prompt Octopus

개발자를 위한 VSCode 확장 프로그램으로, 프롬프트 엔지니어링을 간소화합니다. 코드베이스 내에서 직접 40개 이상의 LLM(OpenAI, Anthropic, Mistral 등) 응답을 나란히 비교하여 모든 작업에 가장 적합한 모델을 효율적으로 찾을 수 있도록 도와줍니다.

모델 관리
Visits 3.5KFavorites 109Likes 105
Freemium

usevelvet

Velvet은 개발자 게이트웨이로, 현재 Arize AI의 일부이며 AI 기반 기능을 분석, 평가 및 모니터링하기 위해 설계되었습니다. AI 관찰 가능성, LLM 추적 및 모델 성능 관리를 위한 포괄적인 스위트를 제공하여 개발자가 개발에서 프로덕션까지 AI 애플리케이션을 구축하고 완성할 수 있도록 돕습니다.

AI 관리
Visits 5.5KFavorites 100Likes 107
Freemium

Ragas

Ragas는 검색 증강 생성(RAG) 파이프라인을 평가하고 테스트하기 위한 오픈 소스 Python 프레임워크입니다. 컨텍스트 검색부터 답변 생성에 이르기까지 LLM 애플리케이션의 성능을 측정하기 위한 다양한 메트릭을 제공합니다. LangChain 및 LlamaIndex와 같은 업계 리더들의 신뢰를 받는 Ragas는 환각 및 무관한 응답과 같은 문제를 식별하고 완화하여 개발자가 더 강력하고 신뢰할 수 있으며 정확한 AI 시스템을 구축하도록 돕습니다.

MLOps
Visits 132KFavorites 94Likes 102
Freemium

Keywords AI

Keywords AI는 AI 스타트업과 개발자를 위해 설계된 포괄적인 LLM 관찰 가능성 및 모니터링 플랫폼입니다. 통합 API를 통해 LLM 워크플로우를 배포, 테스트, 모니터링 및 최적화하며, 200개 이상의 모델을 지원하고 간단한 두 줄의 코드 통합으로 팀이 안정적인 AI 기능을 더 빠르게 구축하고 출시할 수 있도록 돕습니다.

API 관리
Visits 8.6KFavorites 125Likes 126
Freemium

withpi.ai

AI 애플리케이션을 위한 조정 가능하고 빠르며 비용 효율적인 채점 및 평가 시스템을 만들기 위한 개발자 중심 플랫폼입니다. 모델 모니터링, 순위 지정 및 RAG 최적화를 위해 정성적 기준을 정밀한 정량적 지표로 변환합니다.

분석
Visits 3.3KFavorites 127Likes 135
Freemium

Basalt

Basalt는 개발자와 제품 팀이 신뢰할 수 있는 AI 에이전트를 구축, 평가 및 모니터링할 수 있도록 지원하는 엔드투엔드 플랫폼입니다. 자동화된 평가, A/B 테스트, AI 코파일럿을 이용한 프롬프트 엔지니어링, 개발자 친화적인 SDK 등 포괄적인 도구 모음을 제공하여 AI 기능의 신뢰성과 프로덕션 준비 상태를 보장합니다.

AI 에이전트 개발
Visits 10.1KFavorites 91Likes 114
Freemium

Evidently AI

Evidently AI는 LLM 및 ML 모델 모니터링에 특화된 AI 제품을 위한 포괄적인 테스트 및 평가 플랫폼입니다. 자동화된 평가, 합성 데이터 생성, 지속적인 테스트 및 적대적 공격을 통해 팀이 AI의 안전성, 신뢰성 및 성능을 보장하도록 돕습니다. 강력한 오픈 소스 라이브러리를 기반으로 구축되었으며, 데이터 과학자 및 MLOps 엔지니어가 환각, 데이터 드리프트, 개인정보 유출과 같은 문제를 사용자가 경험하기 전에 감지할 수 있도록 설계되었습니다.

머신러닝
Visits 154.9KFavorites 128Likes 135
Freemium

Adaline

Adaline은 제품 및 엔지니어링 팀이 대규모 언어 모델(LLM)을 반복, 평가, 배포 및 모니터링할 수 있도록 지원하는 엔드투엔드 플랫폼입니다. 전체 AI 애플리케이션 라이프사이클을 간소화하여 더 빠른 개발, 향상된 협업 및 신뢰할 수 있는 AI 기반 기능 배포를 가능하게 합니다.

모델 관리
Visits 81.3KFavorites 127Likes 124
Freemium

Confident AI

Confident AI는 엔지니어링 팀을 위한 LLM 평가 및 관찰 가능성 플랫폼입니다. 오픈 소스 DeepEval 라이브러리의 제작자들이 구축했으며, 포괄적인 메트릭, 회귀 테스트 및 상세한 추적을 통해 LLM 애플리케이션을 벤치마킹, 보호 및 개선하여 일관된 AI 성능을 보장합니다.

모델 관리
Visits 104.9KFavorites 101Likes 107
Freemium

RagaAI

RagaAI는 개발자와 기업이 신뢰할 수 있는 AI 애플리케이션을 구축하도록 돕기 위해 설계된 포괄적인 AI 테스트 및 관찰 가능성 플랫폼입니다. AI 에이전트, LLM 및 RAG 시스템을 관찰, 평가 및 디버깅하기 위한 도구 모음을 제공합니다. 주요 기능에는 에이전트 테스트, 실시간 가드레일, 합성 데이터 생성 및 미세 조정 기능이 포함됩니다. RagaAI는 다중 모드 데이터(LLM, 컴퓨터 비전, 표 형식 데이터)를 지원하며 문제 감지에서 해결에 이르기까지 전체 AI 품질 보증 수명 주기를 자동화하여 강력하고 신뢰할 수 있는 AI 배포를 보장하는 것을 목표로 합니다.

분석
Visits 17.5KFavorites 130Likes 130
Paid

AfterQuery

AfterQuery는 고품질의 인간 생성 데이터셋과 오염 없는 벤치마크를 생성하여 기초 모델의 발전을 목표로 하는 AI 연구소입니다. 우수한 훈련 데이터와 엄격한 평가를 통해 모델 성능 향상에 중점을 둡니다.

모델 학습
Visits 748.7KFavorites 117Likes 111
Freemium

promptfoo

promptfoo는 대규모 언어 모델(LLM)을 위한 포괄적인 테스트 및 평가 프레임워크입니다. 개발자와 기업이 체계적인 테스트, 벤치마킹, AI 기반 레드팀을 통해 프롬프트 품질을 비교하고, 모델 성능을 평가하며, AI 보안을 강화할 수 있도록 돕습니다. 50개 이상의 LLM 제공업체와 로컬 모델을 지원하며, 개발자 친화적인 CLI를 통해 개발 워크플로우에 원활하게 통합됩니다.

로우 코드 노 코드
Visits 163.9KFavorites 108Likes 89
Free

BenchLLM

AI 엔지니어를 위해 설계된 강력한 오픈 소스 프레임워크로, 대규모 언어 모델(LLM) 애플리케이션을 평가하고 테스트합니다. BenchLLM은 유연한 API와 강력한 CLI를 제공하여 테스트 스위트를 구축하고, 품질 보고서를 생성하며, 모델 평가를 CI/CD 파이프라인에 통합하여 예측 가능하고 고품질의 결과를 보장합니다.

모델 관리
Visits 4.3KFavorites 128Likes 135
Freemium

getmaxim

getmaxim은 AI 개발팀을 위해 설계된 포괄적인 GenAI 평가 및 관찰 가능성 플랫폼입니다. 사용자는 LLM 및 RAG 파이프라인에 대한 광범위한 평가, 자동화된 테스트, 실시간 프로덕션 모니터링을 통해 AI 애플리케이션을 테스트, 모니터링 및 개선하여 고품질의 신뢰할 수 있고 책임감 있는 AI를 보장할 수 있습니다.

LLM
Visits 105.8KFavorites 135Likes 121
Freemium

Giskard

Giskard는 LLM 기반 애플리케이션을 보호하고 검증하기 위해 설계된 AI 테스트 플랫폼입니다. 기업 팀이 배포 전에 환각, 보안 취약점, 편견 및 성능 문제와 같은 위험을 감지하고 완화하도록 돕습니다. 테스트 생성을 자동화하고 지속적인 레드팀을 통해 Giskard는 AI 에이전트의 신뢰성, 안전성 및 규정 준수를 보장합니다.

모니터링
Visits 45.4KFavorites 136Likes 126
Tag