AI약학연구회kaips

News

스탠퍼드 연구진 “AI 성능시험이 실제 능력을 잘못 잴 수 있다”

스탠퍼드 연구진은 널리 쓰이는 AI 벤치마크(성능을 비교하는 표준 시험) 56개를 분석해, 같은 능력을 잰다는 시험끼리 결과가 엇갈리거나 주장한 특성을 제대로 재지 못하는 사례가 반복됐다고 밝혔습니다. 쉽게 말하면 순위표의 한 점수가 실제 추론 능력이나 안전성을 그대로 보여준다고 믿기 어렵다는 뜻입니다. 구매·투자·규제 판단이 이런 점수에 의존하는 만큼 실제 업무 환경과 언어별 조건에서 별도 검증하는 일이 중요합니다. 두 연구는 학회 발표 예정 결과이므로 점수 하나만으로 의료·규제·운영 환경에 적합하다고 판단해서는 안 됩니다.

AI

원문 보기(새 창에서 열립니다)뉴스 목록

이 글은 연구회가 작성한 한국어 요약입니다. 원문의 저작권은 Stanford HAI에 있으며, 전문은 원문에서 확인해 주세요.

스탠퍼드 연구진 “AI 성능시험이 실제 능력을 잘못 잴 수 있다” | AI약학연구회