| 2024년 3월 29일 |
Gecko: 대규모 언어 모델에서 추출한 다목적 텍스트 임베딩 |
Gecko는 대규모 언어 모델의 지식을 검색기로 추출하여 간결하고 효율적인 텍스트 임베딩을 생성하기 위한 새로운 접근 방식을 도입합니다. |
LLM 임베딩 |
| 2024년 3월 28일 |
Grok-1.5 |
Grok 1.5는 향상된 추론 기능과 128,000개 토큰의 컨텍스트 길이를 제공합니다. |
기초 LLM |
| 2024년 3월 28일 |
데이터를 사용하지 마십시오: sDPO |
sDPO는 단계적 방식으로 선호도 데이터세트의 전략적 사용에 중점을 두고 언어 모델 훈련 영역에 새로운 방법을 도입합니다. |
명령어 튜닝 |
| 2024년 3월 28일 |
Jamba: AI21의 SSM-Transformer 모델 |
AI21 연구소는 SSM 모델의 효율성과 Transformer의 기능 간의 균형을 맞추는 것을 목표로 256K 컨텍스트 창을 제공하는 Jamba의 새로운 SSM-Transformer 모델을 발표했습니다. |
| 2024년 3월 28일 |
STAR-GATE: 수정질문 설명 스타일 교육 |
이 논문에서는 명확한 질문을 하도록 훈련하여 언어 모델의 상호 작용 기술을 향상시키는 새로운 접근 방식인 STAR-GATE를 제시합니다. |
신속한 엔지니어링 |
| 2024년 3월 27일 |
대규모 언어 모델의 긴 형식 사실성 |
이 문서에서는 개방형 주제에 대한 LLM 생성 콘텐츠의 사실성 문제를 다룹니다. |
LLM 사실성 |
| 2024년 3월 27일 |
Mini-Gemini: 다중 양식 비전 언어 모델의 잠재력 발굴 |
Mini-Gemini는 시각적 토큰을 개선하고, 고품질 데이터 세트를 구성하고, 더 나은 성능을 위해 VLM 기반 생성을 안내함으로써 다중 모드 VLM(비전 언어 모델)을 향상시키는 프레임워크를 제시합니다. |
다중 모드 LLM |
| 2024년 3월 27일 |
DBRX |
GPT-3.5와 같은 기존 모델을 능가하고 Gemini 1.0 Pro와 경쟁하는 최첨단 개방형 대형 언어 모델입니다. |
기초 LLM |
| 2024년 3월 25일 |
AIOS: LLM 에이전트 운영 체제 |
AIOS는 리소스 할당을 최적화하고 동시 실행을 활성화하며 액세스 제어를 제공하기 위해 LLM 에이전트 운영 체제로 설계되었습니다. |
자치령 대표 |
| 2024년 3월 22일 |
순위 프롬프트: 단계별 비교를 통해 언어 모델을 더 나은 추론으로 만듭니다 |
이 논문에서는 ChatGPT 및 GPT-4와 같은 대규모 언어 모델의 추론 기능을 향상시키는 것을 목표로 하는 새로운 프롬프트 방법인 RankPrompt를 소개합니다. |
신속한 엔지니어링 |
| 2024년 3월 22일 |
Mora: 다중 에이전트 프레임워크를 통한 일반 비디오 생성 지원 |
Mora는 선구적인 모델인 Sora의 성능과 일치하는 것을 목표로 일반 비디오 생성 기능의 격차를 해결하기 위해 새로운 다중 에이전트 프레임워크를 제안합니다. |
다중 모드 LLM |
| 2024년 3월 22일 |
LLM2LLM: 새로운 반복 데이터 개선으로 LLM 강화 |
본 연구에서는 제한된 데이터를 사용하여 작업 성과를 향상시키기 위해 교사-학생 LLM 프레임워크를 활용한 데이터 향상 전략인 LLM2LLM을 소개합니다. |
데이터 증대 |
| 2024년 3월 21일 |
Adaptive-RAG: 질문 답변을 통해 검색이 강화된 언어 모델을 적용하는 방법을 학습합니다. |
이 논문에서는 새로운 적응형 QA 프레임워크를 소개합니다. |
조각 |
| 2024년 3월 20일 |
위험한 기능에 대한 개척 모델 평가 |
이 논문은 Gemini 1.0 모델을 사용하여 설득, 사이버 보안, 자기 확산, 자기 추론과 같은 영역에 초점을 맞춘 "위험한 능력" 평가를 개척합니다. |
LLM 공격 |
| 2024년 3월 19일 |
휴가용 차량의 최적화 |
이 문서에서는 다양한 오픈 소스 모델을 병합하여 강력한 기반 모델 생성을 자동화하는 새로운 접근 방식을 제시합니다. |
모델 병합 |
| 2024년 3월 19일 |
Agent-FLAN: 호환 언어 모델을 강화하는 에이전트 조정 데이터 및 방법 설계 |
이 문서에서는 NLP 작업의 성능 향상을 위해 에이전트 기능을 대형 언어 모델에 통합하는 문제를 다룹니다. |
요원, 환각 |
| 2024년 3월 18일 |
도구란 무엇입니까? |
이 문서에서는 텍스트 생성 작업을 위한 언어 모델의 성능을 향상시키는 도구의 역할을 자세히 살펴봅니다. |
에이전트, 도구, 설문조사 |
| 2024년 3월 17일 |
Grok-1 |
Grok-1은 Grok-0 모델과 인간의 피드백을 통해 미세 조정된 다음 토큰 예측을 위해 설계된 자동 회귀 Transformer 기반 모델입니다. |
기초 LLM |
| 2024년 3월 15일 |
RAFT: 펭귄별 RAG에 언어 적용 |
이 문서에서는 도메인별 설정에서 질문에 답할 수 있는 대규모 언어 모델의 기능을 향상시키는 것을 목표로 하는 교육 접근 방식인 RAFT(Retrieval Augmented FineTuning)를 소개합니다. |
RAG, 미세 조정 |
| 2024년 3월 14일 |
API로 보호되는 LLM 로그인에서 독점 정보 로그인 |
이 문서에서는 독점 대형 언어 모델에 대한 제한된 API 액세스를 사용하더라도 소수의 API 쿼리에서 중요한 독점 정보를 추론할 수 있음을 보여줍니다. |
LLM 공격, 개인 정보 보호 |
| 2024년 3월 14일 |
Quiet-STAR: 언어 모델은 대화하기 전에 스스로 생각할 것을 제안할 수 있습니다 |
본 논문에서는 언어 모델이 미래 텍스트를 설명하기 위한 근거를 생성하는 방법을 학습하여 예측 능력을 향상시키는 것을 목표로 하는 방법인 Quiet-STaR을 소개합니다. |
신속한 엔지니어링 |
| 2024년 3월 14일 |
MM1: 멀티미디어 LLM 사전 교육을 위한 방법, 분석 및 이해 |
이 문서에서는 고성능 MLLM(Multimodal Large Language Model)의 개발을 살펴보고 다양한 아키텍처 구성 요소와 데이터 선택의 중요성을 조사합니다. |
다중 모드 LLM |
| 2024년 3월 13일 |
LLM에 대한 지식 충돌: 감성조사 |
이 설문조사는 맥락적 지식과 매개변수적 지식의 혼합에 초점을 맞춰 대규모 언어 모델에서 발생하는 지식 갈등의 복잡성을 자세히 살펴봅니다. |
LLM 견고성 |
| 2024년 3월 12일 |
MoAI: 일치하는 언어 및 비전 버전을 사용하여 모든 일치의 형태를 조정합니다. |
MoAI는 대규모 언어 및 비전 모델의 강점을 분할 및 OCR과 같은 작업을 위한 특수 컴퓨터 비전 모델과 결합하는 혁신적인 접근 방식을 도입합니다. |
다중 모드 LLM |
| 2024년 3월 12일 |
Branch-Train-MiX: 전문가 LLM을 전문가 구성 LLM에 혼합 |
이 문서에서는 코딩, 수학 추론 및 세계 지식과 같은 여러 전문 영역에서 탁월한 성능을 발휘하도록 대규모 언어 모델을 효율적으로 훈련하는 방법을 탐구합니다. |
MoE, 기초 LLM |
| 2024년 3월 11일 |
생산언어의 일부를 훔치기 |
본 논문은 OpenAI의 ChatGPT나 Google의 PaLM-2와 같은 블랙박스 생산 언어 모델에서 정확한 정보를 추출할 수 있는 최초의 모델 도용 공격을 제시합니다. |
LLM 공격 |
| 2024년 3월 8일 |
RAT: 확장된 생각 검색은 장수평 영화에서 인식을 통해 유도됩니다. |
본 논문에서는 환각을 줄이면서 장거리 생성 작업에서 대규모 언어 모델의 추론 및 생성 능력을 향상시키는 것을 목표로 하는 방법인 Retrieval Augmented Thoughts(RAT)를 소개합니다. |
RAG, 프롬프트 엔지니어링 |
| 2024년 3월 7일 |
일반적인 7B 언어 모델은 매우 유용한 능력을 보유하고 있습니다. |
이 연구에서는 더 작은 7B 크기의 언어 모델, 특히 LLaMA-2가 이미 강력한 수학적 능력을 보여줌으로써 이러한 기능에 매우 큰 모델이나 광범위한 수학 중심의 사전 훈련이 필요하다는 이전 가정에 도전하는 것으로 나타났습니다. |
도메인별 LLM |
| 2024년 3월 7일 |
ShortGPT: 확장된 언어 모델의 레이어는 예상보다 유용합니다. |
이 문서에서는 대규모 언어 모델의 계층 전반에 걸쳐 높은 수준의 중복성을 보여주는 ShortGPT를 소개합니다. |
소규모 LLM |
| 2024년 3월 7일 |
다른 언어 모델이 있어야 하고 계획할 수 있나요? |
이 논문은 자기비판을 수행하고 잘못된 추측을 수정하는 대규모 언어 모델의 능력에 대해 의문을 제기합니다. 인간은 때때로 이러한 능력을 보여줍니다. |
신속한 엔지니어링 |
| 6 March 2024 |
GaLore: Gradient Low-Rank Projection을 통한 메모리 효율적인 LLM 교육 |
This paper proposes a novel training strategy called GaLore. This approach aims to reduce the memory requirements of training large language models by implementing gradient low-rank projection, significantly cutting down the memory used by optimizer states without sacrificing performance. It allows for the efficient training of large models on consumer-grade GPUs, marking a significant advancement in the accessibility of AI model training. |
Memory Optimization |
| 5 March 2024 |
KnowAgent: LLM 기반 에이전트를 위한 지식 증강 계획 |
The work introduces KnowAgent, a novel approach designed to enhance large language models' planning capabilities by incorporating explicit action knowledge. |
자치령 대표 |
| 4 March 2024 |
Claude 3 모델 계열: Opus, Sonnet, Haiku |
This technical report from Claude introduces Claude 3, a new family of large multimodal models designed to address various needs within the AI landscape. |
기초 LLM |