ToolMage
로그인

Best AI 평가 AI tools

Discover powerful AI 평가 AI tools, including LMArena, Vellum AI, Arize, Humanloop, FutureAGI, Rival, Openlayer, Unify, Scorecard 및 Trismik, and other related products.

Reasoning
Paid

Reasoning

AI 어시스턴트가 무분별하게 동의하는 것을 막기 위해 설계된 구조화된 추론 플랫폼입니다. 가정에 도전하고, 의사결정 루프를 끊고, 구현 전에 구조화된 사고를 강제하는 격리된 세션을 제공합니다.

3D
Visits 3.7KFavorites 1Likes 2
Trismik
Freemium

Trismik

자체 데이터로 50개 이상의 LLM을 몇 분 만에 비교하세요. 품질, 비용, 속도에 대한 증거 기반 모델 결정을 내리세요.

Ai Model Selection
Visits 6.7KFavorites 15Likes 16
Hot100

Hot100

Hot100은 가장 혁신적이고 유용한 AI 기반 프로젝트를 선보이는 역동적인 주간 차트입니다. AI 심사위원 Flambo가 평가하는 실력 기반의 리더보드를 제공하며, 마케팅 과장 광고가 아닌 진정한 유용성과 획기적인 아이디어에 중점을 둡니다. 새로운 트렌드를 발견하고, 작품을 제출하며, 활기찬 AI 빌더 커뮤니티와 소통하세요.

프로젝트 쇼케이스
Visits 4.7KFavorites 109Likes 96
AIGRADE
Freemium

AIGRADE

AIGRADE는 신뢰성, 투명성, 신뢰에 초점을 맞춘 AI 시스템에 대한 독립적인 평가, 점수 산정 및 인증을 제공합니다. ISO/IEC 23894 표준에 부합하며, 기업이 신뢰할 수 있고 규정을 준수하는 AI를 구축할 수 있도록 제3자, SOC2 친화적인 감사 프로세스를 제공합니다.

준수
Visits 3.5KFavorites 93Likes 100
Scorecard
Freemium

Scorecard

Scorecard는 엔터프라이즈 AI 에이전트를 평가, 최적화 및 배포하기 위한 엔드투엔드 플랫폼입니다. 팀이 주관적인 테스트를 구조화된 평가로 대체하도록 돕고, 신뢰할 수 있고 안정적인 AI 애플리케이션을 자신 있게 구축할 수 있도록 지속적인 모니터링, 프롬프트 관리 및 성능 메트릭 도구를 제공합니다.

평가
Visits 12.2KFavorites 128Likes 118
Unify
Freemium

Unify

Unify는 개발자 중심의 LLMOps 플랫폼으로, AI 애플리케이션의 구축, 모니터링 및 최적화를 간소화하도록 설계되었습니다. 로깅, 평가, 추적 및 AI 에이전트 관리를 위한 범용 API와 해킹 가능한 프레임워크를 제공하여 개발자가 맞춤형 워크플로우와 인터페이스를 쉽게 만들 수 있도록 지원합니다.

LLMOps
Visits 14.9KFavorites 114Likes 112
LastMile AI
Freemium

LastMile AI

LastMile AI는 생성형 AI 애플리케이션을 테스트, 평가 및 모니터링하기 위한 엔터프라이즈급 개발자 플랫폼입니다. 맞춤형 평가기 미세 조정, 합성 데이터 생성 및 실시간 모니터링을 위한 AutoEval과 같은 도구를 제공하여 AI 시스템의 신뢰성과 프로덕션 준비 상태를 보장합니다.

모델 평가
Visits 5.3KFavorites 134Likes 135
Openlayer
Freemium

Openlayer

Openlayer는 기업용 AI 평가 및 관찰 가능성 플랫폼입니다. 개발부터 프로덕션까지 전체 라이프사이클에 걸쳐 기존 머신러닝 모델과 대규모 언어 모델(LLM)을 테스트, 모니터링 및 관리하여 신뢰성과 규정 준수를 보장하도록 지원합니다.

분석
Visits 27.8KFavorites 165Likes 168
Rival
Freemium

Rival

Rival은 단순한 벤치마크를 넘어 '분위기'에 초점을 맞춘 독특한 AI 모델 비교 플랫폼입니다. 사용자는 나란히 비교하는 듀얼, 응답 갤러리, 역사적 진화 추적을 통해 GPT, Gemini, Claude와 같은 주요 모델을 직관적으로 비교할 수 있습니다. 다양한 AI의 독특한 개성, 창의적인 스타일, 추론 방식을 발견하여 양적 점수를 넘어 질적이고 직접적인 경험을 통해 특정 작업에 가장 적합한 모델을 찾아보세요.

테스트
Visits 39.1KFavorites 122Likes 112
Vellum AI
Freemium

Vellum AI

Vellum AI는 미션 크리티컬 AI 에이전트 및 애플리케이션을 구축, 평가, 배포하기 위한 엔드투엔드 엔터프라이즈 플랫폼입니다. 오케스트레이션, 프롬프트 엔지니어링, RAG, 평가 및 모니터링을 위한 통합 환경을 제공하여 팀이 신뢰할 수 있는 AI 솔루션을 10배 더 빠르게 구축할 수 있도록 지원합니다.

기업 솔루션
Visits 460.1KFavorites 107Likes 108
Coxwave Align
Paid

Coxwave Align

Coxwave Align은 생성형 AI 제품을 위해 설계된 강력한 분석 엔진입니다. 기업이 챗봇과 같은 LLM 기반 대화형 애플리케이션을 모니터링, 분석 및 평가할 수 있도록 지원합니다. 이 플랫폼은 성능을 개선하고, 환각(hallucination)을 줄이며, 전반적인 사용자 경험과 제품 품질을 향상시키기 위한 실행 가능한 통찰력을 제공합니다.

LLM 관측 가능성
Visits 6.1KFavorites 131Likes 128
FutureAGI
Freemium

FutureAGI

FutureAGI는 기업과 개발자를 위해 설계된 포괄적인 LLM 관찰 가능성 및 평가 플랫폼입니다. AI 애플리케이션을 구축, 평가 및 개선하여 최대 99%의 정확도를 달성하도록 돕고, 합성 데이터 생성, 코드 없는 실험, 다중 모드 평가 및 실시간 프로덕션 모니터링 도구를 제공합니다.

합성 데이터
Visits 39.6KFavorites 123Likes 136
Humanloop
Freemium

Humanloop

Humanloop는 기업용 LLM 평가 및 관찰 가능성 플랫폼입니다. AI 애플리케이션을 개발, 평가, 모니터링하기 위한 포괄적인 도구 모음을 제공하여 팀이 신뢰할 수 있는 AI 제품을 자신 있게 출시하고 확장할 수 있도록 지원합니다. 코드 우선 및 UI 우선 워크플로우를 통해 엔지니어, 제품 관리자, 도메인 전문가 간의 협업을 촉진합니다.

기업 솔루션
Visits 47.5KFavorites 99Likes 105
LMArena
Free

LMArena

LMArena는 UC 버클리 연구원들이 만든 개방형 크라우드소싱 플랫폼으로, 선도적인 AI 모델을 평가하고 비교합니다. 사용자는 두 모델을 나란히 익명으로 테스트하고 최고의 응답에 투표하여 역동적인 공개 리더보드에 기여합니다. AI의 발전을 투명하게 만들고 실제 인간의 피드백에 기반을 두는 것을 목표로 합니다.

인공지능
Visits 628.4KFavorites 105Likes 87
Arize
Freemium

Arize

Arize는 개발, 관찰 가능성 및 평가를 위해 설계된 AI 및 에이전트 엔지니어링 플랫폼입니다. 팀이 LLM 및 ML 모델을 더 빠르게 구축, 모니터링, 디버깅 및 개선할 수 있도록 통합 솔루션을 제공합니다. 개발과 프로덕션 간의 루프를 닫음으로써 Arize는 AI 시스템이 대규모로 안정적이고 신뢰할 수 있으며 고성능을 발휘하도록 보장합니다.

MLOps
Visits 251.6KFavorites 89Likes 85
Tag