| 2025년 1월 30일 |
GuardReasoner: 강력한 기반 LLM 보호 장치를 식별하여 |
LLM이 안전이 중요한 애플리케이션에 점점 더 영향을 미치면서 가드레일을 사용하여 안전을 보장하는 것이 여전히 중요한 과제로 남아 있습니다. |
| 2025년 1월 29일 |
생체의 반응: 조정하는 비평을 배우는 것이 모방하는 법을 배우는 것보다 더 효과가 있습니다. |
SFT(Supervised Fine-Tuning)는 일반적으로 주어진 명령에 대해 주석이 달린 응답을 모방하도록 언어 모델을 훈련하는 데 사용됩니다. |
| 2025년 1월 28일 |
SFT 암기, RL 일반화: 기초 모델 후처리 비교 연구 연구 |
SFT(지도 미세 조정) 및 RL(강화 학습)은 기초 모델에 대한 학습 후 기술로 널리 사용됩니다. |
| 2025년 1월 24일 |
검색 체인 생성 |
이 논문에서는 최종 답을 생성하기 전에 관련 정보를 단계별로 검색하고 추론하는 o1과 유사한 RAG 모델을 훈련하는 접근 방식을 소개합니다. |
| 2025년 1월 24일 |
인력의 최종시험 |
벤치마크는 LLM(대형 언어 모델) 기능의 급속한 발전을 추적하는 데 중요한 도구입니다. |
| 2025년 1월 23일 |
CoT로 이미지를 생성할 수 있나요? |
CoT(사고 사슬) 추론은 복잡한 이해 작업을 해결하기 위해 대규모 모델에서 광범위하게 탐색되었습니다. |
| 2025년 1월 22일 |
SRMT: 다중 에이전트 평생 경로 찾기를 위한 공유 메모리 |
MARL(다중 에이전트 강화 학습)은 다양한 환경에서 협력적이고 경쟁적인 다중 에이전트 문제를 해결하는 데 있어 상당한 진전을 보여줍니다. |
| 2025년 1월 22일 |
VideoLLaMA 3: 이미지 및 비디오 이해를 Frontier 다중 소스 기반 모델 |
본 논문에서는 이미지 및 비디오 이해를 위한 보다 발전된 다중 모드 기반 모델인 VideoLLaMA3를 제안합니다. |
| 2025년 1월 22일 |
DeepSeek-R1: 학습을 통해 LLM의 능력 능력 발휘 |
1세대 추론 모델인 DeepSeek-R1-Zero 및 DeepSeek-R1을 소개합니다. |
| 2025년 1월 21일 |
MMVU: 전문 분야의 다분야 동영상 이해도 측정 |
비디오 이해의 기초 모델을 평가하기 위한 포괄적인 전문가 수준의 다분야 벤치마크인 MMVU를 소개합니다. |
| 2025년 1월 21일 |
UI-TARS: 응집력을 강화한 GUI 보병 |
본 논문에서는 스크린샷을 입력으로만 인식하고 인간과 유사한 상호 작용(예: 키보드 및 마우스 작업)을 수행하는 기본 GUI 에이전트 모델인 UI-TARS를 소개합니다. |
| 2025년 1월 21일 |
세부 사항: 전문 전문가 편집 모델 교육을 로드 밸런싱하는 형태 |
이 문서에서는 MoE(Mixture-of-Experts) 모델을 교육할 때 $\textbf{L}$oad-$\textbf{b}$alancing $\textbf{L}$oss(LBL) 구현을 다시 살펴봅니다. |
| 2025년 1월 20일 |
Agent-R: 반복적인 산악 훈련을 통해 성찰하도록 언어 모델 요원 훈련 |
LLM(대형 언어 모델) 에이전트는 대화형 환경에서 복잡한 작업을 처리하는 데 점점 더 중추적인 역할을 하고 있습니다. |
| 2025년 1월 17일 |
PaSa: 종합 학술 논문 검색을 통해 LLM 에이전트 |
대규모 언어 모델을 기반으로 하는 고급 Paper Search 에이전트인 PaSa를 소개합니다. |
| 2025년 1월 17일 |
논리적인 LLM 사고의 진화 |
우리는 대규모 언어 모델에서 추론 시간 계산을 확장하기 위한 혁신적인 검색 전략을 탐구합니다. |
| 2025년 1월 16일 |
VideoWorld: 라벨이 없는 동영상에서 학습하는 지식 추구 |
이 연구에서는 LLM(대형 언어 모델)과 같은 텍스트 기반 모델에 중점을 두는 것과 달리 심층 생성 모델이 시각적 입력만으로 복잡한 지식을 학습할 수 있는지 여부를 탐구합니다. |
| 2025년 1월 16일 |
재구축 및 생성을 나타내는 의미나이저 축소를 학습합니다. |
자동 인코딩을 통한 시각적 토큰화는 픽셀을 잠재 공간으로 압축하여 최첨단 이미지 및 비디오 생성 모델을 강화합니다. |
| 2025년 1월 16일 |
확산 모델의 제거 단계 조정을 넘어서는 시간 조정 |
생성 모델은 주로 확장 법칙의 특징인 현상인 데이터, 계산 리소스 및 모델 크기를 증가시켜 훈련 중에 확장할 수 있는 능력으로 인해 다양한 영역에 걸쳐 상당한 영향을 미쳤습니다. |
| 2025년 1월 16일 |
풍선 기능 모델을 사용하여 기념할 수 있습니다. |
언어는 오랫동안 인간의 추론에 필수적인 도구로 여겨져 왔습니다. |
| 2025년 1월 14일 |
MiniMax-01: Lightning Attention으로 기본 모델 확장 |
MiniMax-Text-01 및 MiniMax-VL-01을 포함한 MiniMax-01 시리즈를 소개합니다. 이 시리즈는 최상위 모델과 비교할 수 있으면서도 더 긴 컨텍스트를 처리하는 데 탁월한 기능을 제공합니다. |
| 2025년 1월 14일 |
LLM 교육을 표시한 데이터 세트의 우수 사례 |
많은 AI 회사가 저작권 소유자의 허가 없이 데이터에 대한 대규모 언어 모델(LLM)을 교육하고 있습니다. |
| 2025년 1월 14일 |
지침을 다양하게 단일 분석을 다양하게 편집할 수 있는 AI 부조종사 |
대규모 언어 모델은 복잡한 자연어 명령을 해석하는 데 탁월하여 광범위한 작업을 수행할 수 있습니다. |
| 2025년 1월 13일 |
수학적 능력에서 프로세서 모델 개발의 솔루션 |
프로세스 보상 모델(PRM)은 추론 프로세스의 중간 오류를 식별하고 완화하는 것을 목표로 하는 LLM(대형 언어 모델)의 수학적 추론에서 프로세스 감독을 위한 유망한 접근 방식으로 등장합니다. |
| 11th January 2025 |
ChemAgent: 대응 버전의 자동 교체로 교체 가능 |
화학적 추론에는 일반적으로 정확한 계산이 필요한 복잡한 다단계 프로세스가 포함되며, 사소한 오류라도 연속적인 실패로 이어질 수 있습니다. |
| 2025년 1월 11일 |
Tensor 제품에 관심을 유도하는 것입니다. |
더 긴 입력 시퀀스를 처리하기 위해 언어 모델을 확장하려면 일반적으로 큰 키-값(KV) 캐시가 필요하므로 추론 중에 상당한 메모리 오버헤드가 발생합니다. |
| 2025년 1월 10일 |
LlamaV-o1: LLM의 오류를 보고할 내용이 있습니다. |
추론은 특히 순차적인 단계별 이해가 필수적인 시각적 맥락에서 복잡한 다단계 문제를 해결하기 위한 기본 기능입니다. |
| 2025년 1월 10일 |
VideoRAG: Video 코퍼스를 불러오기 생성 |
RAG(Retrieval-Augmented Generation)는 쿼리와 관련된 외부 지식을 검색하고 이를 생성 프로세스에 통합하여 기반 모델에서 실제로 잘못된 출력을 생성하는 문제를 해결하는 강력한 전략입니다. |
| 2025년 1월 10일 |
자부심을 갖고 헌신적으로 활동 |
놀라운 성능에도 불구하고 LLM(대형 언어 모델)의 개발은 확장 가능한 감독이라는 중요한 과제에 직면해 있습니다. 즉, 사람의 평가가 어렵거나 LLM이 사람보다 성능이 뛰어난 작업에 대한 효과적인 피드백을 제공하는 것입니다. |
| 2025년 1월 9일 |
GAN은 죽었습니다. |
GAN은 훈련하기 어렵다는 주장이 널리 퍼져 있으며 문헌의 GAN 아키텍처는 경험적 트릭으로 가득 차 있습니다. |
| 2025년 1월 9일 |
Search-o1: 에이전트 검색으로 강화된 대규모 추론 모델 |
OpenAI-o1과 같은 대형 추론 모델(LRM)은 대규모 강화 학습을 통해 인상적인 긴 단계적 추론 기능을 보여주었습니다. |
| 2025년 1월 9일 |
플러그인 모델에서 인간과의 상호작용 |
이 문서에서는 LLM(대형 언어 모델)을 더욱 인간과 비슷하게 만드는 발전 방법을 살펴봅니다. |
| 2025년 1월 8일 |
LLM의 시스템 2 행위에 의해 피해를 입히는 행위 체인으로 사고하는 방법 |
우리는 특정 CoT에 도달하는 데 필요한 기본 추론을 명시적으로 모델링하여 기존 CoT(사고 사슬)를 확장하는 새로운 프레임워크인 Meta-CoT(메타 사고 사슬)를 제안합니다. |
| 2025년 1월 8일 |
절단별 효율적인 RAG를 사용하여 다음 작업을 처리합니다. |
검색 증강 생성(RAG)은 환각적이거나 오래된 정보 생성과 같은 일반적인 제한 사항을 해결할 수 있기 때문에 LLM(대형 언어 모델)을 배포할 때 어디에나 사용됩니다. |
| 2025년 1월 8일 |
rStar-Math: 소형 LLM은 자기발전을 위한 연구로 생각하는 것이 마스터할 수 있습니다. |
우리는 소규모 언어 모델(SLM)이 우수한 모델을 추출하지 않고도 OpenAI o1의 수학 추론 기능과 경쟁하거나 능가할 수 있음을 보여주기 위해 rStar-Math를 제시합니다. |
| 2025년 1월 8일 |
에이전트 연구소: LLM 에이전트를 연구 보조원으로 활용 |
역사적으로 과학적 발견은 초기 구상부터 최종 결과까지 상당한 시간과 자원을 요구하는 길고 비용이 많이 드는 과정이었습니다. |
| 2025년 1월 7일 |
VLM은 자율 주행을 위한 준비가 되어 있습니까? |
VLM(Vision-Language Model)의 최근 발전으로 인해 자율 주행, 특히 자연어를 통해 해석 가능한 운전 결정을 내리는 데 대한 관심이 촉발되었습니다. |
| 2025년 1월 7일 |
OmniManip: 공간 제약 조건으로서 객체 중심 상호 작용 프리미티브를 통한 일반적인 로봇 조작을 향하여 |
비정형 환경에서 조작할 수 있는 일반 로봇 시스템을 개발하는 것은 중요한 과제입니다. |
| 2025년 1월 7일 |
기념 AI를 기념하는 코스모스 월드 재단 모델 플랫폼 |
물리적 AI는 먼저 디지털 방식으로 훈련되어야 합니다. |
| 2025년 1월 6일 |
GeAR: 연결 접속 |
문서 검색 기술은 대규모 정보 시스템 개발의 기초를 형성합니다. |
| 2025년 1월 5일 |
테스트 시간 컴퓨팅: 시스템 1 사고에서 시스템 2 사고로 |
복잡한 추론에서 o1 모델의 놀라운 성능은 테스트 시간 컴퓨팅 확장이 모델의 잠재력을 더욱 발휘하여 강력한 System-2 사고를 가능하게 함을 보여줍니다. |
| 2025년 1월 4일 |
REINFORCE++: 호환 언어 선택을 간단하고 효율적으로 접근하는 방식 |
인간 피드백을 통한 강화 학습(RLHF)은 대규모 언어 모델을 인간 선호도에 맞추기 위한 중요한 접근 방식으로 등장했으며, PPO(근위 정책 최적화), DPO(직접 선호 최적화), RLOO(REINFORCE Leave One-Out), ReMax 및 GRPO(그룹 상대 정책 최적화)와 같은 방법을 통해 빠른 알고리즘 발전을 목격했습니다. |
| 2025년 1월 4일 |
호환되는 언어 모델을 기반으로 한 개인화된 그래프 기반 검색 |
LLM(대형 언어 모델)이 발전함에 따라 개인화된 상황 인식 응답을 제공하는 능력은 사용자 경험을 개선할 수 있는 혁신적인 잠재력을 제공합니다. |
| 2025년 1월 3일 |
처녀 자리: o1과 인사 MLLM 사용에 대한 탐색 |
최근에는 LLM(대형 언어 모델)을 기반으로 구축된 느린 사고 추론 시스템이 추론 중 사고 시간을 확장하여 광범위한 주목을 받고 있습니다. |
| 2025년 1월 1일 |
2.5년 클라스: 잘 들리는 프로그램 교육을 몇 개의 모드에서만 사용하세요 |
이미지-텍스트 쌍 데이터와 비교하여 인터리브 코퍼스를 사용하면 VLM(Vision-Language Model)이 인간처럼 세상을 더 자연스럽게 이해할 수 있습니다. |
| 2024년 12월 31일 |
사람이 라벨링하지 않는 이미지 안전을 보장하는 MLLM 보호기 |
온라인 플랫폼에서 영상 미디어가 증가하면서 이미지 콘텐츠 안전이 중요한 과제가 되었습니다. |
| 2024년 12월 27일 |
OS-Genesis: 역방향 노동을 견디기 GUI 요원 궤적 구성 요소 |
VLM(Vision-Language Models)을 기반으로 하는 그래픽 사용자 인터페이스(GUI) 에이전트는 인간과 유사한 컴퓨터 제어 기능을 보여주었습니다. |