이름 요약 주제
2024년 3월 29일 Gecko: 대규모 언어 모델에서 추출한 다목적 텍스트 임베딩 Gecko는 대규모 언어 모델의 지식을 검색기로 추출하여 간결하고 효율적인 텍스트 임베딩을 생성하기 위한 새로운 접근 방식을 도입합니다. LLM 임베딩
2024년 3월 28일 Grok-1.5 Grok 1.5는 향상된 추론 기능과 128,000개 토큰의 컨텍스트 길이를 제공합니다. 기초 LLM
2024년 3월 28일 데이터를 사용하지 마십시오: sDPO sDPO는 단계적 방식으로 선호도 데이터세트의 전략적 사용에 중점을 두고 언어 모델 훈련 영역에 새로운 방법을 도입합니다. 명령어 튜닝
2024년 3월 28일 Jamba: AI21의 SSM-Transformer 모델 AI21 연구소는 SSM 모델의 효율성과 Transformer의 기능 간의 균형을 맞추는 것을 목표로 256K 컨텍스트 창을 제공하는 Jamba의 새로운 SSM-Transformer 모델을 발표했습니다.
2024년 3월 28일 STAR-GATE: 수정질문 설명 스타일 교육 이 논문에서는 명확한 질문을 하도록 훈련하여 언어 모델의 상호 작용 기술을 향상시키는 새로운 접근 방식인 STAR-GATE를 제시합니다. 신속한 엔지니어링
2024년 3월 27일 대규모 언어 모델의 긴 형식 사실성 이 문서에서는 개방형 주제에 대한 LLM 생성 콘텐츠의 사실성 문제를 다룹니다. LLM 사실성
2024년 3월 27일 Mini-Gemini: 다중 양식 비전 언어 모델의 잠재력 발굴 Mini-Gemini는 시각적 토큰을 개선하고, 고품질 데이터 세트를 구성하고, 더 나은 성능을 위해 VLM 기반 생성을 안내함으로써 다중 모드 VLM(비전 언어 모델)을 향상시키는 프레임워크를 제시합니다. 다중 모드 LLM
2024년 3월 27일 DBRX GPT-3.5와 같은 기존 모델을 능가하고 Gemini 1.0 Pro와 경쟁하는 최첨단 개방형 대형 언어 모델입니다. 기초 LLM
2024년 3월 25일 AIOS: LLM 에이전트 운영 체제 AIOS는 리소스 할당을 최적화하고 동시 실행을 활성화하며 액세스 제어를 제공하기 위해 LLM 에이전트 운영 체제로 설계되었습니다. 자치령 대표
2024년 3월 22일 순위 프롬프트: 단계별 비교를 통해 언어 모델을 더 나은 추론으로 만듭니다 이 논문에서는 ChatGPT 및 GPT-4와 같은 대규모 언어 모델의 추론 기능을 향상시키는 것을 목표로 하는 새로운 프롬프트 방법인 RankPrompt를 소개합니다. 신속한 엔지니어링
2024년 3월 22일 Mora: 다중 에이전트 프레임워크를 통한 일반 비디오 생성 지원 Mora는 선구적인 모델인 Sora의 성능과 일치하는 것을 목표로 일반 비디오 생성 기능의 격차를 해결하기 위해 새로운 다중 에이전트 프레임워크를 제안합니다. 다중 모드 LLM
2024년 3월 22일 LLM2LLM: 새로운 반복 데이터 개선으로 LLM 강화 본 연구에서는 제한된 데이터를 사용하여 작업 성과를 향상시키기 위해 교사-학생 LLM 프레임워크를 활용한 데이터 향상 전략인 LLM2LLM을 소개합니다. 데이터 증대
2024년 3월 21일 Adaptive-RAG: 질문 답변을 통해 검색이 강화된 언어 모델을 적용하는 방법을 학습합니다. 이 논문에서는 새로운 적응형 QA 프레임워크를 소개합니다. 조각
2024년 3월 20일 위험한 기능에 대한 개척 모델 평가 이 논문은 Gemini 1.0 모델을 사용하여 설득, 사이버 보안, 자기 확산, 자기 추론과 같은 영역에 초점을 맞춘 "위험한 능력" 평가를 개척합니다. LLM 공격
2024년 3월 19일 휴가용 차량의 최적화 이 문서에서는 다양한 오픈 소스 모델을 병합하여 강력한 기반 모델 생성을 자동화하는 새로운 접근 방식을 제시합니다. 모델 병합
2024년 3월 19일 Agent-FLAN: 호환 언어 모델을 강화하는 에이전트 조정 데이터 및 방법 설계 이 문서에서는 NLP 작업의 성능 향상을 위해 에이전트 기능을 대형 언어 모델에 통합하는 문제를 다룹니다. 요원, 환각
2024년 3월 18일 도구란 무엇입니까? 이 문서에서는 텍스트 생성 작업을 위한 언어 모델의 성능을 향상시키는 도구의 역할을 자세히 살펴봅니다. 에이전트, 도구, 설문조사
2024년 3월 17일 Grok-1 Grok-1은 Grok-0 모델과 인간의 피드백을 통해 미세 조정된 다음 토큰 예측을 위해 설계된 자동 회귀 Transformer 기반 모델입니다. 기초 LLM
2024년 3월 15일 RAFT: 펭귄별 RAG에 언어 적용 이 문서에서는 도메인별 설정에서 질문에 답할 수 있는 대규모 언어 모델의 기능을 향상시키는 것을 목표로 하는 교육 접근 방식인 RAFT(Retrieval Augmented FineTuning)를 소개합니다. RAG, 미세 조정
2024년 3월 14일 API로 보호되는 LLM 로그인에서 독점 정보 로그인 이 문서에서는 독점 대형 언어 모델에 대한 제한된 API 액세스를 사용하더라도 소수의 API 쿼리에서 중요한 독점 정보를 추론할 수 있음을 보여줍니다. LLM 공격, 개인 정보 보호
2024년 3월 14일 Quiet-STAR: 언어 모델은 대화하기 전에 스스로 생각할 것을 제안할 수 있습니다 본 논문에서는 언어 모델이 미래 텍스트를 설명하기 위한 근거를 생성하는 방법을 학습하여 예측 능력을 향상시키는 것을 목표로 하는 방법인 Quiet-STaR을 소개합니다. 신속한 엔지니어링
2024년 3월 14일 MM1: 멀티미디어 LLM 사전 교육을 위한 방법, 분석 및 이해 이 문서에서는 고성능 MLLM(Multimodal Large Language Model)의 개발을 살펴보고 다양한 아키텍처 구성 요소와 데이터 선택의 중요성을 조사합니다. 다중 모드 LLM
2024년 3월 13일 LLM에 대한 지식 충돌: 감성조사 이 설문조사는 맥락적 지식과 매개변수적 지식의 혼합에 초점을 맞춰 대규모 언어 모델에서 발생하는 지식 갈등의 복잡성을 자세히 살펴봅니다. LLM 견고성
2024년 3월 12일 MoAI: 일치하는 언어 및 비전 버전을 사용하여 모든 일치의 형태를 조정합니다. MoAI는 대규모 언어 및 비전 모델의 강점을 분할 및 OCR과 같은 작업을 위한 특수 컴퓨터 비전 모델과 결합하는 혁신적인 접근 방식을 도입합니다. 다중 모드 LLM
2024년 3월 12일 Branch-Train-MiX: 전문가 LLM을 전문가 구성 LLM에 혼합 이 문서에서는 코딩, 수학 추론 및 세계 지식과 같은 여러 전문 영역에서 탁월한 성능을 발휘하도록 대규모 언어 모델을 효율적으로 훈련하는 방법을 탐구합니다. MoE, 기초 LLM
2024년 3월 11일 생산언어의 일부를 훔치기 본 논문은 OpenAI의 ChatGPT나 Google의 PaLM-2와 같은 블랙박스 생산 언어 모델에서 정확한 정보를 추출할 수 있는 최초의 모델 도용 공격을 제시합니다. LLM 공격
2024년 3월 8일 RAT: 확장된 생각 검색은 장수평 영화에서 인식을 통해 유도됩니다. 본 논문에서는 환각을 줄이면서 장거리 생성 작업에서 대규모 언어 모델의 추론 및 생성 능력을 향상시키는 것을 목표로 하는 방법인 Retrieval Augmented Thoughts(RAT)를 소개합니다. RAG, 프롬프트 엔지니어링
2024년 3월 7일 일반적인 7B 언어 모델은 매우 유용한 능력을 보유하고 있습니다. 이 연구에서는 더 작은 7B 크기의 언어 모델, 특히 LLaMA-2가 이미 강력한 수학적 능력을 보여줌으로써 이러한 기능에 매우 큰 모델이나 광범위한 수학 중심의 사전 훈련이 필요하다는 이전 가정에 도전하는 것으로 나타났습니다. 도메인별 LLM
2024년 3월 7일 ShortGPT: 확장된 언어 모델의 레이어는 예상보다 유용합니다. 이 문서에서는 대규모 언어 모델의 계층 전반에 걸쳐 높은 수준의 중복성을 보여주는 ShortGPT를 소개합니다. 소규모 LLM
2024년 3월 7일 다른 언어 모델이 있어야 하고 계획할 수 있나요? 이 논문은 자기비판을 수행하고 잘못된 추측을 수정하는 대규모 언어 모델의 능력에 대해 의문을 제기합니다. 인간은 때때로 이러한 능력을 보여줍니다. 신속한 엔지니어링
6 March 2024 GaLore: Gradient Low-Rank Projection을 통한 메모리 효율적인 LLM 교육 This paper proposes a novel training strategy called GaLore. This approach aims to reduce the memory requirements of training large language models by implementing gradient low-rank projection, significantly cutting down the memory used by optimizer states without sacrificing performance. It allows for the efficient training of large models on consumer-grade GPUs, marking a significant advancement in the accessibility of AI model training. Memory Optimization
5 March 2024 KnowAgent: LLM 기반 에이전트를 위한 지식 증강 계획 The work introduces KnowAgent, a novel approach designed to enhance large language models' planning capabilities by incorporating explicit action knowledge. 자치령 대표
4 March 2024 Claude 3 모델 계열: Opus, Sonnet, Haiku This technical report from Claude introduces Claude 3, a new family of large multimodal models designed to address various needs within the AI landscape. 기초 LLM