:star2: 가장 영향력 있는 AI 평가 논문

(2025년 1월 ~ 2025년 10월)

AI 평가 분야는 AI 시스템에 대한 강력하고 포괄적이며 신뢰할 수 있는 평가 방법의 필요성에 따라 2025년에 성장을 경험했습니다.

  1. LLM 심사위원 및 자동 평가: 심사위원으로서의 LLM 접근 방식을 포함하여 AI 시스템을 사용하여 다른 AI 시스템을 평가하는 방법입니다.
  2. 벤치마크 및 데이터세트: AI 모델 성능을 평가하기 위한 종합 평가 벤치마크 및 데이터세트입니다.
  3. 영역별 평가: 금융, 과학, 의학 등 특정 영역에 맞춰진 전문 평가 프레임워크입니다.
  4. 다중 모드 평가: 시각 언어, 시청각 및 기타 다중 모드 AI 시스템에 대한 평가 방법입니다.
  5. 추론 및 인지 평가: AI 모델의 추론, 논리, 인지 능력을 평가하기 위한 프레임워크입니다.
  6. 평가 방법론: AI 시스템 평가를 위한 새로운 접근 방식 및 프레임워크.
  7. 강건성 및 안전성 평가: 모델의 견고성, 안전성 및 신뢰성을 평가하는 방법입니다.
  8. 평가 설문조사: 평가 접근 방식 및 방법론에 대한 종합적인 검토 및 설문조사입니다.

이 표는 새로운 평가 연구가 나올 때마다 정기적으로 계속 업데이트됩니다!

설명 태그
UniGenBench++: 텍스트-이미지 생성을 통합 의미한다는 평가 벤치마크 이 문서에서는 통합 의미론적 평가 측정항목을 통해 텍스트-이미지 생성 모델을 평가하기 위한 포괄적인 벤치마크인 UniGenBench++를 소개합니다. 벤치마크 및 데이터 세트 2025년 10월
OmniVideoBench: Omni MLLM의 시청각 이해를 평가하여 이 문서에서는 옴니 다중 모드 대형 언어 모델의 시청각 이해 기능을 평가하기 위해 특별히 설계된 포괄적인 평가 프레임워크인 OmniVideoBench를 제시합니다. 다중모달 평가 2025년 10월
BEAR: 무기 형태를 지원하며 다양한 형태의 도구 모델 벤치 제작 및 강화 BEAR는 다중 모드 언어 모델의 원자 구현 기능을 평가하고 개선하기 위한 포괄적인 벤치마크를 소개합니다. 다중모달 평가 2025년 10월
CompassVerifier: LLM 평가 및 결과 보상기를 통합하여 강력한 검증기 CompassVerifier는 답변 평가 및 결과 보상을 위한 통합되고 강력한 검증 시스템을 도입하여 LLM 평가의 근본적인 한계를 해결합니다. LLM 심사위원 및 자동 평가 2025년 8월
점수에서 기술까지: 키보드 기능 모델 평가를 기호 프레임워크 이 문서에서는 재정적 대형 언어 모델에 대한 상세한 기술 기반 평가를 제공하기 위해 전통적인 채점 방법을 뛰어넘는 인지 진단 프레임워크를 소개합니다. 도메인별 평가 2025년 8월
SciArena: 과학 게임의 기초 모델을 표시하는 평가 플랫폼 SciArena는 과학 문헌 작업에 대한 기초 모델의 성능을 평가하기 위해 특별히 설계된 개방형 평가 플랫폼을 구축합니다. 도메인별 평가 2025년 7월
VS-Bench: 다중 에이전트 성능에서 뛰어난 성능 및 의사결정을 위해 VLM 평가 VS-Bench는 다중 에이전트 환경 내 전략적 추론 및 의사 결정에서 Vision-Language Models의 기능을 평가하기 위한 전문 벤치마크를 도입합니다. 추론 및 인지 평가 2025년 6월
VideoReasonBench: MLLM이 연동형 비디오를 보유할 수 있나요? VideoReasonBench는 비디오 콘텐츠에 대한 복잡한 추론을 수행하는 다중 모드 대형 언어 모델의 능력을 테스트하기 위한 포괄적인 평가 프레임워크를 만듭니다. 다중모달 평가 2025년 5월
VisuLogic: 다수의 대형 아이콘 모델에서 표시하는 기능 평가를 벤치마크 VisuLogic은 6가지 추론 범주에 걸쳐 인간이 검증한 1,000개의 문제에 대한 벤치마크를 도입하여 시각적 추론 평가를 다룹니다. 다중모달 평가 2025년 4월
LLM 기반 에이전트 평가 조사 이 포괄적인 설문 조사는 LLM 기반 에이전트에 대한 평가 방법론의 현재 환경을 조사하여 기존 접근 방식, 과제 및 향후 방향에 대한 체계적인 개요를 제공합니다. 평가 설문조사 2025년 3월
선호 누출: LLM-as-a-judge의 활동 문제 이 문서에서는 판사가 공유 아키텍처, 상속 또는 가족 관계를 통해 관련된 모델에 대해 편견을 보이는 "선호 누출"이라는 판사로서의 LLM 시스템의 편견 문제를 식별합니다. LLM 심사위원 및 자동 평가 2025년 2월
SuperGPQA: 285개 대학원 사각에 위치 LLM 평가 축소 SuperGPQA는 285개 대학원 수준 분야에 걸쳐 LLM 평가를 확장하는 평가 벤치마크를 도입합니다. 벤치마크 및 데이터 세트 2025년 2월
LIBERO-Plus: 포함-언어-액션 모델의 찾기 키보드 분석 LIBERO-Plus는 Vision-Language-Action 모델의 견고성 분석을 수행하여 다양한 까다로운 조건과 섭동 하에서 성능을 검사합니다. 견고성 및 안전성 평가 2025년 10월
생각이 사실입니다: 확장된 외부 LM을 재사용할 수 있습니다. 이 논문에서는 모델이 사실 정보를 추론 프로세스와 통합하는 방법에 중점을 두고 긴 맥락 언어 모델의 추론 능력을 평가하기 위한 평가 방법론을 탐구합니다. 추론 및 인지 평가 2025년 10월
추론은 언제 중요합니까? 이 통제된 연구는 다양한 작업 전반에 걸쳐 전체 모델 성능에 대한 추론 능력의 기여도를 체계적으로 평가합니다. 추론 및 인지 평가 2025년 9월
ReviewScore: 대규모 언어 모델을 사용한 잘못된 정보의 동료 검토 감지 ReviewScore는 학술 환경에서 잘못된 정보나 문제가 있는 동료 리뷰를 감지하기 위해 대규모 언어 모델을 사용하여 LLM 평가의 새로운 응용 프로그램을 소개합니다. LLM 심사위원 및 자동 평가 2025년 9월
SWE-QA: 언어 유형이 다른 질문에 답할 수 있습니까? SWE-QA는 소프트웨어 저장소에 대한 질문을 이해하고 답변하는 언어 모델의 능력을 테스트하기 위한 평가 프레임워크를 만듭니다. 도메인별 평가 2025년 9월
역IFEval: LLM이 실제 지침을 액세서리를 위해 완고한 교육 관례를 배울 수 있는 재고? 이 문서에서는 뿌리 깊은 교육 패턴을 극복하고 잠재적으로 모순될 수 있는 새로운 지침을 따르는 LLM의 능력을 평가하는 Inverse IFEval을 소개합니다. 평가 방법론 2025년 9월
추진력학: LLM에 도전하여 넌센스를 확장적으로 해석합니다. Drivel-ology는 무의미한 텍스트를 명백한 깊이로 해석하고 분석하도록 요구함으로써 LLM의 추론 능력을 테스트하는 독특한 평가 접근 방식을 제시합니다. 추론 및 인지 평가 2025년 9월
대규모 헬리콥터 모델 조사: 데이터 기반 에이전트 프론티어까지 이 포괄적인 설문 조사에서는 데이터 기반에서 자동 에이전트 응용 프로그램에 이르는 평가 접근 방식을 다루는 과학적 대형 언어 모델에 대한 평가 방법론을 조사합니다. 평가 설문조사 2025년 9월
중요한 경우: LLM을 문자열로 처리하는 방법 이 연구에서는 구두점 민감도에 초점을 맞춰 LLM의 프롬프트 견고성을 평가하고 개선하는 방법을 비교합니다. 견고성 및 안전성 평가 2025년 8월
GPT-5가 공간 지능을 달성했습니까? 이 실증적 연구는 여러 공간 추론 작업에 대한 체계적인 테스트를 통해 GPT-5의 공간 지능 기능에 대한 포괄적인 평가를 제공합니다. 추론 및 인지 평가 2025년 8월
CMPhysBench: 응집 물질 물리학에서 대규모 언어 모델을 평가하기 위한 벤치마크 CMPhysBench는 응집 물질 물리학에서 LLM 성능을 평가하고, 모델의 복잡한 물리적 개념에 대한 이해, 수학적 공식 및 이 특정 영역 내에서의 과학적 추론을 테스트하기 위한 전문 벤치마크를 도입합니다. 도메인별 평가 2025년 8월
GPT-4o는 시력을 얼마나 잘 이해합니까? 이 문서에서는 표준 컴퓨터 비전 작업 전반에 걸쳐 GPT-4o의 비전 이해 기능을 체계적으로 평가합니다. 다중모달 평가 2025년 7월
추론인가 암기인가? 이 중요한 평가 연구는 강화 학습 평가에서 잠재적인 데이터 오염 및 기억 문제를 조사하고 현재 평가 방법론의 신뢰성에 의문을 제기합니다. 평가 방법론 2025년 7월
Zebra-CoT: 인터리브 비전 언어 추론을 위한 데이터 세트 Zebra-CoT는 인터리브 비전 언어 추론 기능을 평가하기 위한 전문 데이터 세트 및 평가 프레임워크를 도입합니다. 다중모달 평가 2025년 7월
OST-Bench: 온라인 시공간 이해에서 MLLM의 기능 평가 OST-Bench는 온라인 시공간 장면을 이해하는 다중 모드 대형 언어 모델의 기능을 평가하기 위한 포괄적인 벤치마크를 제공합니다. 다중모달 평가 2025년 7월
OmniSpatial: 비전 홀더형 홀더 홀더 홀더 벤치마크 OmniSpatial은 2D 및 3D 추론, 공간 관계, 기하학적 이해를 비롯한 공간 이해의 다양한 측면을 다루는 비전 언어 모델을 위한 포괄적인 공간 추론 평가 프레임워크를 만듭니다. 추론 및 인지 평가 2025년 6월
대처의 첫 번째 테스트: 인식, 이해 및 이해를 돕기 위해 MLLM의 인식 능력 조사 이 평가 프레임워크는 인식, 이해 및 추론 능력을 포괄하는 포괄적인 시험을 통해 다중 모드 대형 언어 모델의 인지 능력을 조사합니다. 추론 및 인지 평가 2025년 6월
CSVQA: VLM의 STEM 기능 기능 평가를 중국 다수의 모드 벤치 마크 CSVQA는 Vision-Language Models의 STEM 추론 기능을 평가하기 위한 전문 중국어 다중 모드 벤치마크를 도입합니다. 도메인별 평가 2025년 6월
MultiFinBen: 금융 LLM 평가를 다국어, 다양한 모드 및 실내 장식품 마크 MultiFinBen은 다국어 지원, 다중 모드 기능 및 어려움 인식 평가를 통합하는 금융 LLM을 위한 포괄적인 평가 프레임워크를 제공합니다. 도메인별 평가 2025년 6월
KRIS-Bench: 그리워하는 이미지 편집 코너 벤치마킹 KRIS-Bench는 차세대 지능형 이미지 편집 모델을 위한 평가 방법론을 도입하여 기본 편집을 넘어 이미지 조작 작업의 상황별 이해, 창의적 향상 및 지침 따르기를 포함하는 기능을 테스트합니다. 다중모달 평가 2025년 5월
BizFinBench: LLM 평가를 통해 비즈니스 중심의 실제 금융 벤치마크 BizFinBench는 실제 금융 시나리오와 비즈니스 컨텍스트를 사용하여 금융 LLM을 위한 비즈니스 중심 평가 프레임워크를 만듭니다. 도메인별 평가 2025년 5월
MME는 MLLM의 교체를 환영합니다. MME-Reasoning은 특히 다중 모드 대형 언어 모델의 논리적 추론 기능을 평가하기 위한 포괄적인 벤치마크를 개발합니다. 추론 및 인지 평가 2025년 5월
MMLongBench: 상황에 맞는 장거리 언어 모델을 효과적이고 매력적으로 벤치마킹하기 MMLongBench는 긴 컨텍스트 기능을 갖춘 비전 언어 모델을 평가하는 과제를 해결하고 확장된 시각적 및 텍스트 시퀀스를 처리하는 모델에 대한 포괄적인 평가 방법을 제공합니다. 다중모달 평가 2025년 5월
ScienceBoard: 현실적인 과학 워크플로에서 다중 모드 자율 에이전트 평가 ScienceBoard creates evaluation frameworks for multimodal autonomous agents operating in realistic scientific workflows, testing their ability to conduct research, analyze data, and generate scientific insights. 도메인별 평가 2025년 5월
PaperBench: AI 연구를 복제하는 AI의 능력 평가 PaperBench introduces a unique evaluation framework that tests AI systems' ability to replicate AI research processes, from literature review to experimental design and result analysis. This meta-evaluation approach provides insights into how well AI systems understand and can contribute to the research process itself. 도메인별 평가 2025년 4월
PHYBench: 권위 있는 버전의 인식 및 압류에 대한 전체 평가 PHYBench는 대규모 언어 모델의 물리적 인식 및 추론 기능에 대한 포괄적인 평가를 제공하고 물리 법칙에 대한 이해 테스트, 인과 관계 및 실제 물리학 적용을 제공합니다. 추론 및 인지 평가 2025년 4월
ColorBench: VLM이 다채로운 세계를 보고 이해할 수 있습니까? ColorBench는 Vision-Language Models의 색상 인식, 추론 및 견고성을 테스트하기 위한 전문 평가 프레임워크를 만듭니다. 다중모달 평가 2025년 4월
xVerify: 추론 모델 평가를 위한 효율적인 답변 검증기 xVerify는 추론 모델의 답변 품질과 정확성을 평가하기 위해 특별히 설계된 효율적인 검증 시스템을 도입합니다. LLM 심사위원 및 자동 평가 2025년 4월
Creation-MMBench: 상황에 따라 위치 결정 평가 Creation-MMBench는 상황 인식 창의적 생성 및 추론에 중점을 두고 다중 모드 모델에서 창의적 지능을 평가하기 위한 평가 방법론을 개발합니다. 다중모달 평가 2025년 3월
의무의 경계에 대한 제한: 올림피아드 고급 수학 벤치마크 이 벤치마크는 고급 수학적 통찰력과 창의적인 문제 해결이 필요한 올림피아드 수준의 문제를 사용하여 수학적 추론을 평가합니다. 추론 및 인지 평가 2025년 3월
확장된 확장 변수에 관한 결합 조사 이 포괄적인 설문 조사에서는 매우 긴 텍스트 시퀀스를 처리하는 모델에 대한 평가 접근 방식을 다루면서 긴 컨텍스트 언어 모델링의 평가 방법론과 과제를 조사합니다. 평가 설문조사 2025년 3월
슬라이더 클립 아트를 효율적으로 사용하기 위한 작업 이 설문 조사에서는 대규모 추론 모델에서 효율적인 추론을 위한 평가 접근 방식을 탐색하고 추론 품질과 계산 효율성 간의 균형을 조사합니다. 평가 설문조사 2025년 3월
MMTEB: 전설적인 다국어 임베딩 벤치마크 MMTEB는 다양한 언어와 작업에 걸쳐 텍스트 임베딩 모델을 평가하기 위한 대규모 다국어 벤치마크를 도입합니다. 벤치마크 및 데이터 세트 2025년 2월
BenchMAX: 플러그인 모델을 전반적으로 다국어 평가 제품군 BenchMAX는 다양한 언어, 문화 및 언어 현상에 걸쳐 LLM 성과를 평가하는 다국어 평가 제품군을 만듭니다. 벤치마크 및 데이터 세트 2025년 2월
기반 모델의 신뢰성: 생성, 평가 및 권한 이 문서에서는 신뢰성, 공정성, 투명성 및 안전 측면을 다루면서 생성 기반 모델의 신뢰성을 평가하기 위한 포괄적인 지침과 평가 프레임워크를 제공합니다. 견고성 및 안전성 평가 2025년 2월
URSA: 다중 플러스 수학의 사고력을 이해하고 검증 URSA는 다양한 수학적 맥락에서 사고의 연쇄 추론을 이해하고 검증하기 위한 평가 방법론을 개발합니다. 추론 및 인지 평가 2025년 1월
손님관식 질문: 본인이 소속된 언어의 모델이 틀렸을 때에도 더욱 그렇습니다. 이 연구는 객관식 시나리오에서 추론 프로세스와 모델 신뢰도 사이의 관계를 평가하여 추론이 잘못된 답변에 대해서도 모델 자신감을 어떻게 높일 수 있는지 보여줍니다. 평가 방법론 2025년 1월
MLLM 벤치마크의 구문 이 문서에서는 평가 데이터 세트의 중복 문제를 해결하여 효과적인 MLLM 벤치마크를 생성하기 위한 원칙을 설정합니다. 평가 방법론 2025년 1월
특정 언어 모델: 청사진 이 청사진 문서는 언어 모델의 추론 기능을 이해하고 평가하기 위한 포괄적인 프레임워크를 제공하며 추론 중심 평가 방법론을 설계하기 위한 체계적인 접근 방식을 제공합니다. 평가 방법론 2025년 1월
InternLM-XComposer2.5-Reward: 간단하면서도 많은 양의 보충제 모델 본 논문에서는 AI 시스템 출력의 자동 평가를 위해 설계된 다중 모드 보상 모델을 소개하고 다중 모드 생성 작업에 대한 효율적인 평가 방법을 제공합니다. LLM 심사위원 및 자동 평가 2025년 1월
LLM4SR: 과학 연구를 호환하는 언어 모델에 대한 설문조사 LLM4SR은 과학 연구 응용 프로그램에서 대규모 언어 모델에 대한 평가 방법론에 대한 포괄적인 조사를 제공하고 다양한 과학 영역 및 연구 작업 흐름 전반에 걸쳐 평가 접근 방식을 검토합니다. 평가 설문조사 2025년 1월
RealCritic: 언어 모델 비평의 효과를 평가하여 RealCritic은 효과 중심 평가 프레임워크를 도입하여 언어 모델의 비평 기능을 평가하는 문제를 해결합니다. LLM 심사위원 및 자동 평가 2025년 1월