AI 평가 분야는 AI 시스템에 대한 강력하고 포괄적이며 신뢰할 수 있는 평가 방법의 필요성에 따라 2025년에 성장을 경험했습니다.
이 표는 새로운 평가 연구가 나올 때마다 정기적으로 계속 업데이트됩니다!
| 설명 | 태그 | 월 | |
|---|---|---|---|
| UniGenBench++: 텍스트-이미지 생성을 통합 의미한다는 평가 벤치마크 | 이 문서에서는 통합 의미론적 평가 측정항목을 통해 텍스트-이미지 생성 모델을 평가하기 위한 포괄적인 벤치마크인 UniGenBench++를 소개합니다. | 벤치마크 및 데이터 세트 | 2025년 10월 |
| OmniVideoBench: Omni MLLM의 시청각 이해를 평가하여 | 이 문서에서는 옴니 다중 모드 대형 언어 모델의 시청각 이해 기능을 평가하기 위해 특별히 설계된 포괄적인 평가 프레임워크인 OmniVideoBench를 제시합니다. | 다중모달 평가 | 2025년 10월 |
| BEAR: 무기 형태를 지원하며 다양한 형태의 도구 모델 벤치 제작 및 강화 | BEAR는 다중 모드 언어 모델의 원자 구현 기능을 평가하고 개선하기 위한 포괄적인 벤치마크를 소개합니다. | 다중모달 평가 | 2025년 10월 |
| CompassVerifier: LLM 평가 및 결과 보상기를 통합하여 강력한 검증기 | CompassVerifier는 답변 평가 및 결과 보상을 위한 통합되고 강력한 검증 시스템을 도입하여 LLM 평가의 근본적인 한계를 해결합니다. | LLM 심사위원 및 자동 평가 | 2025년 8월 |
| 점수에서 기술까지: 키보드 기능 모델 평가를 기호 프레임워크 | 이 문서에서는 재정적 대형 언어 모델에 대한 상세한 기술 기반 평가를 제공하기 위해 전통적인 채점 방법을 뛰어넘는 인지 진단 프레임워크를 소개합니다. | 도메인별 평가 | 2025년 8월 |
| SciArena: 과학 게임의 기초 모델을 표시하는 평가 플랫폼 | SciArena는 과학 문헌 작업에 대한 기초 모델의 성능을 평가하기 위해 특별히 설계된 개방형 평가 플랫폼을 구축합니다. | 도메인별 평가 | 2025년 7월 |
| VS-Bench: 다중 에이전트 성능에서 뛰어난 성능 및 의사결정을 위해 VLM 평가 | VS-Bench는 다중 에이전트 환경 내 전략적 추론 및 의사 결정에서 Vision-Language Models의 기능을 평가하기 위한 전문 벤치마크를 도입합니다. | 추론 및 인지 평가 | 2025년 6월 |
| VideoReasonBench: MLLM이 연동형 비디오를 보유할 수 있나요? | VideoReasonBench는 비디오 콘텐츠에 대한 복잡한 추론을 수행하는 다중 모드 대형 언어 모델의 능력을 테스트하기 위한 포괄적인 평가 프레임워크를 만듭니다. | 다중모달 평가 | 2025년 5월 |
| VisuLogic: 다수의 대형 아이콘 모델에서 표시하는 기능 평가를 벤치마크 | VisuLogic은 6가지 추론 범주에 걸쳐 인간이 검증한 1,000개의 문제에 대한 벤치마크를 도입하여 시각적 추론 평가를 다룹니다. | 다중모달 평가 | 2025년 4월 |
| LLM 기반 에이전트 평가 조사 | 이 포괄적인 설문 조사는 LLM 기반 에이전트에 대한 평가 방법론의 현재 환경을 조사하여 기존 접근 방식, 과제 및 향후 방향에 대한 체계적인 개요를 제공합니다. | 평가 설문조사 | 2025년 3월 |
| 선호 누출: LLM-as-a-judge의 활동 문제 | 이 문서에서는 판사가 공유 아키텍처, 상속 또는 가족 관계를 통해 관련된 모델에 대해 편견을 보이는 "선호 누출"이라는 판사로서의 LLM 시스템의 편견 문제를 식별합니다. | LLM 심사위원 및 자동 평가 | 2025년 2월 |
| SuperGPQA: 285개 대학원 사각에 위치 LLM 평가 축소 | SuperGPQA는 285개 대학원 수준 분야에 걸쳐 LLM 평가를 확장하는 평가 벤치마크를 도입합니다. | 벤치마크 및 데이터 세트 | 2025년 2월 |
| LIBERO-Plus: 포함-언어-액션 모델의 찾기 키보드 분석 | LIBERO-Plus는 Vision-Language-Action 모델의 견고성 분석을 수행하여 다양한 까다로운 조건과 섭동 하에서 성능을 검사합니다. | 견고성 및 안전성 평가 | 2025년 10월 |
| 생각이 사실입니다: 확장된 외부 LM을 재사용할 수 있습니다. | 이 논문에서는 모델이 사실 정보를 추론 프로세스와 통합하는 방법에 중점을 두고 긴 맥락 언어 모델의 추론 능력을 평가하기 위한 평가 방법론을 탐구합니다. | 추론 및 인지 평가 | 2025년 10월 |
| 추론은 언제 중요합니까? | 이 통제된 연구는 다양한 작업 전반에 걸쳐 전체 모델 성능에 대한 추론 능력의 기여도를 체계적으로 평가합니다. | 추론 및 인지 평가 | 2025년 9월 |
| ReviewScore: 대규모 언어 모델을 사용한 잘못된 정보의 동료 검토 감지 | ReviewScore는 학술 환경에서 잘못된 정보나 문제가 있는 동료 리뷰를 감지하기 위해 대규모 언어 모델을 사용하여 LLM 평가의 새로운 응용 프로그램을 소개합니다. | LLM 심사위원 및 자동 평가 | 2025년 9월 |
| SWE-QA: 언어 유형이 다른 질문에 답할 수 있습니까? | SWE-QA는 소프트웨어 저장소에 대한 질문을 이해하고 답변하는 언어 모델의 능력을 테스트하기 위한 평가 프레임워크를 만듭니다. | 도메인별 평가 | 2025년 9월 |
| 역IFEval: LLM이 실제 지침을 액세서리를 위해 완고한 교육 관례를 배울 수 있는 재고? | 이 문서에서는 뿌리 깊은 교육 패턴을 극복하고 잠재적으로 모순될 수 있는 새로운 지침을 따르는 LLM의 능력을 평가하는 Inverse IFEval을 소개합니다. | 평가 방법론 | 2025년 9월 |
| 추진력학: LLM에 도전하여 넌센스를 확장적으로 해석합니다. | Drivel-ology는 무의미한 텍스트를 명백한 깊이로 해석하고 분석하도록 요구함으로써 LLM의 추론 능력을 테스트하는 독특한 평가 접근 방식을 제시합니다. | 추론 및 인지 평가 | 2025년 9월 |
| 대규모 헬리콥터 모델 조사: 데이터 기반 에이전트 프론티어까지 | 이 포괄적인 설문 조사에서는 데이터 기반에서 자동 에이전트 응용 프로그램에 이르는 평가 접근 방식을 다루는 과학적 대형 언어 모델에 대한 평가 방법론을 조사합니다. | 평가 설문조사 | 2025년 9월 |
| 중요한 경우: LLM을 문자열로 처리하는 방법 | 이 연구에서는 구두점 민감도에 초점을 맞춰 LLM의 프롬프트 견고성을 평가하고 개선하는 방법을 비교합니다. | 견고성 및 안전성 평가 | 2025년 8월 |
| GPT-5가 공간 지능을 달성했습니까? | 이 실증적 연구는 여러 공간 추론 작업에 대한 체계적인 테스트를 통해 GPT-5의 공간 지능 기능에 대한 포괄적인 평가를 제공합니다. | 추론 및 인지 평가 | 2025년 8월 |
| CMPhysBench: 응집 물질 물리학에서 대규모 언어 모델을 평가하기 위한 벤치마크 | CMPhysBench는 응집 물질 물리학에서 LLM 성능을 평가하고, 모델의 복잡한 물리적 개념에 대한 이해, 수학적 공식 및 이 특정 영역 내에서의 과학적 추론을 테스트하기 위한 전문 벤치마크를 도입합니다. | 도메인별 평가 | 2025년 8월 |
| GPT-4o는 시력을 얼마나 잘 이해합니까? | 이 문서에서는 표준 컴퓨터 비전 작업 전반에 걸쳐 GPT-4o의 비전 이해 기능을 체계적으로 평가합니다. | 다중모달 평가 | 2025년 7월 |
| 추론인가 암기인가? | 이 중요한 평가 연구는 강화 학습 평가에서 잠재적인 데이터 오염 및 기억 문제를 조사하고 현재 평가 방법론의 신뢰성에 의문을 제기합니다. | 평가 방법론 | 2025년 7월 |
| Zebra-CoT: 인터리브 비전 언어 추론을 위한 데이터 세트 | Zebra-CoT는 인터리브 비전 언어 추론 기능을 평가하기 위한 전문 데이터 세트 및 평가 프레임워크를 도입합니다. | 다중모달 평가 | 2025년 7월 |
| OST-Bench: 온라인 시공간 이해에서 MLLM의 기능 평가 | OST-Bench는 온라인 시공간 장면을 이해하는 다중 모드 대형 언어 모델의 기능을 평가하기 위한 포괄적인 벤치마크를 제공합니다. | 다중모달 평가 | 2025년 7월 |
| OmniSpatial: 비전 홀더형 홀더 홀더 홀더 벤치마크 | OmniSpatial은 2D 및 3D 추론, 공간 관계, 기하학적 이해를 비롯한 공간 이해의 다양한 측면을 다루는 비전 언어 모델을 위한 포괄적인 공간 추론 평가 프레임워크를 만듭니다. | 추론 및 인지 평가 | 2025년 6월 |
| 대처의 첫 번째 테스트: 인식, 이해 및 이해를 돕기 위해 MLLM의 인식 능력 조사 | 이 평가 프레임워크는 인식, 이해 및 추론 능력을 포괄하는 포괄적인 시험을 통해 다중 모드 대형 언어 모델의 인지 능력을 조사합니다. | 추론 및 인지 평가 | 2025년 6월 |
| CSVQA: VLM의 STEM 기능 기능 평가를 중국 다수의 모드 벤치 마크 | CSVQA는 Vision-Language Models의 STEM 추론 기능을 평가하기 위한 전문 중국어 다중 모드 벤치마크를 도입합니다. | 도메인별 평가 | 2025년 6월 |
| MultiFinBen: 금융 LLM 평가를 다국어, 다양한 모드 및 실내 장식품 마크 | MultiFinBen은 다국어 지원, 다중 모드 기능 및 어려움 인식 평가를 통합하는 금융 LLM을 위한 포괄적인 평가 프레임워크를 제공합니다. | 도메인별 평가 | 2025년 6월 |
| KRIS-Bench: 그리워하는 이미지 편집 코너 벤치마킹 | KRIS-Bench는 차세대 지능형 이미지 편집 모델을 위한 평가 방법론을 도입하여 기본 편집을 넘어 이미지 조작 작업의 상황별 이해, 창의적 향상 및 지침 따르기를 포함하는 기능을 테스트합니다. | 다중모달 평가 | 2025년 5월 |
| BizFinBench: LLM 평가를 통해 비즈니스 중심의 실제 금융 벤치마크 | BizFinBench는 실제 금융 시나리오와 비즈니스 컨텍스트를 사용하여 금융 LLM을 위한 비즈니스 중심 평가 프레임워크를 만듭니다. | 도메인별 평가 | 2025년 5월 |
| MME는 MLLM의 교체를 환영합니다. | MME-Reasoning은 특히 다중 모드 대형 언어 모델의 논리적 추론 기능을 평가하기 위한 포괄적인 벤치마크를 개발합니다. | 추론 및 인지 평가 | 2025년 5월 |
| MMLongBench: 상황에 맞는 장거리 언어 모델을 효과적이고 매력적으로 벤치마킹하기 | MMLongBench는 긴 컨텍스트 기능을 갖춘 비전 언어 모델을 평가하는 과제를 해결하고 확장된 시각적 및 텍스트 시퀀스를 처리하는 모델에 대한 포괄적인 평가 방법을 제공합니다. | 다중모달 평가 | 2025년 5월 |
| ScienceBoard: 현실적인 과학 워크플로에서 다중 모드 자율 에이전트 평가 | ScienceBoard creates evaluation frameworks for multimodal autonomous agents operating in realistic scientific workflows, testing their ability to conduct research, analyze data, and generate scientific insights. | 도메인별 평가 | 2025년 5월 |
| PaperBench: AI 연구를 복제하는 AI의 능력 평가 | PaperBench introduces a unique evaluation framework that tests AI systems' ability to replicate AI research processes, from literature review to experimental design and result analysis. This meta-evaluation approach provides insights into how well AI systems understand and can contribute to the research process itself. | 도메인별 평가 | 2025년 4월 |
| PHYBench: 권위 있는 버전의 인식 및 압류에 대한 전체 평가 | PHYBench는 대규모 언어 모델의 물리적 인식 및 추론 기능에 대한 포괄적인 평가를 제공하고 물리 법칙에 대한 이해 테스트, 인과 관계 및 실제 물리학 적용을 제공합니다. | 추론 및 인지 평가 | 2025년 4월 |
| ColorBench: VLM이 다채로운 세계를 보고 이해할 수 있습니까? | ColorBench는 Vision-Language Models의 색상 인식, 추론 및 견고성을 테스트하기 위한 전문 평가 프레임워크를 만듭니다. | 다중모달 평가 | 2025년 4월 |
| xVerify: 추론 모델 평가를 위한 효율적인 답변 검증기 | xVerify는 추론 모델의 답변 품질과 정확성을 평가하기 위해 특별히 설계된 효율적인 검증 시스템을 도입합니다. | LLM 심사위원 및 자동 평가 | 2025년 4월 |
| Creation-MMBench: 상황에 따라 위치 결정 평가 | Creation-MMBench는 상황 인식 창의적 생성 및 추론에 중점을 두고 다중 모드 모델에서 창의적 지능을 평가하기 위한 평가 방법론을 개발합니다. | 다중모달 평가 | 2025년 3월 |
| 의무의 경계에 대한 제한: 올림피아드 고급 수학 벤치마크 | 이 벤치마크는 고급 수학적 통찰력과 창의적인 문제 해결이 필요한 올림피아드 수준의 문제를 사용하여 수학적 추론을 평가합니다. | 추론 및 인지 평가 | 2025년 3월 |
| 확장된 확장 변수에 관한 결합 조사 | 이 포괄적인 설문 조사에서는 매우 긴 텍스트 시퀀스를 처리하는 모델에 대한 평가 접근 방식을 다루면서 긴 컨텍스트 언어 모델링의 평가 방법론과 과제를 조사합니다. | 평가 설문조사 | 2025년 3월 |
| 슬라이더 클립 아트를 효율적으로 사용하기 위한 작업 | 이 설문 조사에서는 대규모 추론 모델에서 효율적인 추론을 위한 평가 접근 방식을 탐색하고 추론 품질과 계산 효율성 간의 균형을 조사합니다. | 평가 설문조사 | 2025년 3월 |
| MMTEB: 전설적인 다국어 임베딩 벤치마크 | MMTEB는 다양한 언어와 작업에 걸쳐 텍스트 임베딩 모델을 평가하기 위한 대규모 다국어 벤치마크를 도입합니다. | 벤치마크 및 데이터 세트 | 2025년 2월 |
| BenchMAX: 플러그인 모델을 전반적으로 다국어 평가 제품군 | BenchMAX는 다양한 언어, 문화 및 언어 현상에 걸쳐 LLM 성과를 평가하는 다국어 평가 제품군을 만듭니다. | 벤치마크 및 데이터 세트 | 2025년 2월 |
| 기반 모델의 신뢰성: 생성, 평가 및 권한 | 이 문서에서는 신뢰성, 공정성, 투명성 및 안전 측면을 다루면서 생성 기반 모델의 신뢰성을 평가하기 위한 포괄적인 지침과 평가 프레임워크를 제공합니다. | 견고성 및 안전성 평가 | 2025년 2월 |
| URSA: 다중 플러스 수학의 사고력을 이해하고 검증 | URSA는 다양한 수학적 맥락에서 사고의 연쇄 추론을 이해하고 검증하기 위한 평가 방법론을 개발합니다. | 추론 및 인지 평가 | 2025년 1월 |
| 손님관식 질문: 본인이 소속된 언어의 모델이 틀렸을 때에도 더욱 그렇습니다. | 이 연구는 객관식 시나리오에서 추론 프로세스와 모델 신뢰도 사이의 관계를 평가하여 추론이 잘못된 답변에 대해서도 모델 자신감을 어떻게 높일 수 있는지 보여줍니다. | 평가 방법론 | 2025년 1월 |
| MLLM 벤치마크의 구문 | 이 문서에서는 평가 데이터 세트의 중복 문제를 해결하여 효과적인 MLLM 벤치마크를 생성하기 위한 원칙을 설정합니다. | 평가 방법론 | 2025년 1월 |
| 특정 언어 모델: 청사진 | 이 청사진 문서는 언어 모델의 추론 기능을 이해하고 평가하기 위한 포괄적인 프레임워크를 제공하며 추론 중심 평가 방법론을 설계하기 위한 체계적인 접근 방식을 제공합니다. | 평가 방법론 | 2025년 1월 |
| InternLM-XComposer2.5-Reward: 간단하면서도 많은 양의 보충제 모델 | 본 논문에서는 AI 시스템 출력의 자동 평가를 위해 설계된 다중 모드 보상 모델을 소개하고 다중 모드 생성 작업에 대한 효율적인 평가 방법을 제공합니다. | LLM 심사위원 및 자동 평가 | 2025년 1월 |
| LLM4SR: 과학 연구를 호환하는 언어 모델에 대한 설문조사 | LLM4SR은 과학 연구 응용 프로그램에서 대규모 언어 모델에 대한 평가 방법론에 대한 포괄적인 조사를 제공하고 다양한 과학 영역 및 연구 작업 흐름 전반에 걸쳐 평가 접근 방식을 검토합니다. | 평가 설문조사 | 2025년 1월 |
| RealCritic: 언어 모델 비평의 효과를 평가하여 | RealCritic은 효과 중심 평가 프레임워크를 도입하여 언어 모델의 비평 기능을 평가하는 문제를 해결합니다. | LLM 심사위원 및 자동 평가 | 2025년 1월 |