Anthropic은 Claude Code에 대한 새로운 플러그인 평가 워크플로를 게시했습니다. claude 플러그인 eval 명령은 현실적인 프롬프트에 대해 플러그인을 실행하고, Claude가 생성한 등급을 매기고, 그 결과를 플러그가 실행된 실행과 비교합니다.
새로운 모델은 기능과 가격 대비 성능의 경계를 재설정합니다. 팀은 출시로 인해 달러당 가능한 것이 바뀔 때마다 무엇을 구축할지 재평가합니다.
요약은 정보 제공 목적으로만 집계되었습니다. 전체 내용을 보려면 소스 링크를 따르세요. 데모 항목은 예시입니다.