| 2024년 8월 28일 |
Eagle: 전투를 전투 특수 모드 LLM의 설계 공간 탐색 |
복잡한 시각적 정보를 정확하게 해석하는 능력은 다중 모드 대형 언어 모델(MLLM)의 중요한 주제입니다. |
| 2024년 8월 27일 |
라마의 전역바: 하이브리드 모델의 복제 및 기념 |
Mamba와 같은 선형 RNN 아키텍처는 유리한 배포 특성을 가지면서 언어 모델링에서 Transformer 모델과 경쟁할 수 있습니다. |
| 2024년 8월 27일 |
Text2SQL만으로 충분하지 않습니다: TAG AI와 데이터베이스 통합 |
데이터베이스를 통해 자연어 질문을 제공하는 AI 시스템은 엄청난 가치를 창출할 것을 약속합니다. |
| 2024년 8월 26일 |
음악의 기초 모델: 설문조사 |
최근에는 LLM(대형 언어 모델) 및 LDM(잠재 확산 모델)과 같은 기초 모델(FM)이 음악을 포함한 다양한 분야에 큰 영향을 미쳤습니다. |
| 2024년 8월 22일 |
대응하는 언어 모델을 제어하는 텍스트 생성: 응답 조사 |
NLP(자연어 처리)에서 LLM(대형 언어 모델)은 높은 텍스트 생성 품질을 보여주었습니다. |
| 2024년 8월 22일 |
Jamba-1.5: 콘서트 라이브 Transformer-Mamba 모델 |
우리는 Jamba 아키텍처를 기반으로 하는 새로운 명령 조정 대형 언어 모델인 Jamba-1.5를 제시합니다. |
| 2024년 8월 21일 |
GRAB: 2개의 추가 편집 사진을 추가로 사용 가능 |
LMM(대형 다중 모드 모델)은 다양한 시각적 작업 전반에 걸쳐 능숙함을 보여주었습니다. |
| 2024년 8월 21일 |
실제 LLM 가지치기 및 해석: Minitron 접근 방식 |
우리는 가지치기와 증류를 사용하여 Llama 3.1 8B 및 Mistral NeMo 12B 모델을 각각 4B 및 8B 매개변수로 압축하는 방법에 대한 포괄적인 보고서를 제시합니다. |
| 2024년 8월 21일 |
하와이에서 사용하는 사용자의 효율적인 감지 |
ChatGPT 및 Gemini와 같은 대규모 언어 모델(LLM)은 자연어 처리를 크게 발전시켜 챗봇 및 자동화된 콘텐츠 생성과 같은 다양한 애플리케이션을 가능하게 합니다. |
| 2024년 8월 20일 |
Open-FinLLM: 멋진 구조를 개방형 다중 모드 대형 음향 모델 |
LLM(대형 언어 모델)은 고급 재무 애플리케이션을 갖추고 있지만 충분한 금융 지식이 부족하고 테이블 및 시계열 데이터와 같은 다중 모드 입력과 관련된 작업에 어려움을 겪는 경우가 많습니다. |
| 2024년 8월 20일 |
코드를 작성하시겠습니까, 아니면 코드를 작성하지 않으십니까? |
코드용으로 특별히 설계되지 않은 모델의 경우에도 사전 학습 데이터 혼합에 코드를 포함하는 것이 LLM 사전 학습에서 일반적인 관행이 되었습니다. |
| 2024년 8월 20일 |
전략가: 2단계 트리 검색을 통한 LLM의 전략적 기술 학습 |
본 논문에서는 LLM을 활용하여 자기 개선 과정을 통해 멀티 에이전트 게임을 플레이하기 위한 새로운 기술을 습득하는 새로운 전략가 방법을 제안합니다. |
| 2024년 8월 19일 |
LongVILA: 긴 동영상을 설명하는 긴 텍스트 설명 모델 확장 |
긴 컨텍스트 기능은 다중 모드 기반 모델, 특히 긴 비디오 이해에 매우 중요합니다. |
| 2024년 8월 17일 |
TableBench: 질문 테이블을 전체적으로 덮고 벤치마크 |
최근 LLM(대형 언어 모델)의 발전으로 표 형식 데이터의 해석 및 처리가 크게 향상되어 이전에는 상상할 수 없었던 기능이 도입되었습니다. |
| 2024년 8월 16일 |
LLM 시대의 저자 귀속: 문제, 방법론 및 주제 |
저자의 정확한 귀속은 디지털 콘텐츠의 무결성을 유지하고 법의학 조사를 개선하며 잘못된 정보와 표절의 위험을 완화하는 데 매우 중요합니다. |
| 2024년 8월 15일 |
에이전트 시스템의 자동화 설계 |
연구자들은 강력한 범용 에이전트를 개발하는 데 상당한 노력을 기울이고 있으며, 여기서 기초 모델은 에이전트 시스템(예: 생각의 사슬, 자기 반영, 도구 형성기) 내의 모듈로 사용됩니다. |
| 2024년 8월 15일 |
기분 좋은 기억을 감지하여 움직임을 감지합니다. |
신경망을 훈련시키는 것은 지식을 돌에 새기는 것과 유사한 모놀리식 노력입니다. 일단 프로세스가 완료되면 모든 정보가 네트워크의 가중치에 걸쳐 분산되기 때문에 네트워크에서 지식을 편집하는 것은 거의 불가능합니다. |
| 2024년 8월 14일 |
TurboEdit: 문자 기반 이미지 편집 |
우리는 몇 단계의 확산 모델의 맥락에서 정확한 이미지 반전과 얽힌 이미지 편집의 문제를 해결합니다. |
| 2024년 8월 13일 |
LongWriter: Long Context LLM에서 10,000개 이상 단어 생성 활용 |
현재의 긴 컨텍스트 대형 언어 모델(LLM)은 최대 100,000개의 토큰까지 입력을 처리할 수 있지만 2,000단어라는 적당한 길이를 초과하는 출력을 생성하는 데 어려움을 겪습니다. |
| 2024년 8월 13일 |
OpenResearcher: 복제된 과학 연구를 AI로 활용 |
과학 문헌의 급속한 성장은 해당 분야의 최신 발전에 대한 최신 정보를 얻고 새로운 영역을 탐구하려는 연구자에게 심각한 과제를 안겨줍니다. |
| 2024년 8월 12일 |
AI가 완전하게 개방됨을 발견하여 감지할 수 있습니다. |
일반 인공지능의 가장 큰 과제 중 하나는 과학적 연구를 수행하고 새로운 지식을 발견할 수 있는 에이전트를 개발하는 것입니다. |
| 2024년 8월 12일 |
특수한 문제를 통해 LLM이 더 효과적으로 처리할 수 있는 문제 |
본 논문에서는 미세 조정이나 우수한 모델 없이 작은 언어 모델(SLM)의 추론 능력을 크게 향상시키는 셀프 플레이 상호 추론 접근 방식인 rStar를 소개합니다. |
| 2024년 8월 9일 |
Gemma 범위: Gemma 2에서 동시에 희소 자동 서비스 제공 |
SAE(Sparse Autoencoder)는 신경망의 잠재 표현을 겉보기에 해석 가능한 특징으로 희소 분해하는 방법을 학습하기 위한 비지도 방법입니다. |
| 2024년 8월 8일 |
Transformer 설명: 텍스트 생성의 대화형 학습 |
Transformers는 기계 학습에 혁명을 일으켰지만 내부 작동 방식은 많은 사람들에게 여전히 불투명합니다. |
| 2024년 8월 8일 |
전설적인 사랑을 더 잘해 |
우리는 LLM(대형 언어 모델) 정렬을 위한 세계 지식을 기반으로 한 고품질 합성 데이터를 구축하기 위해 명령 앞뒤 번역이라는 새로운 방법을 제안합니다. |
| 2024년 8월 8일 |
LLM-DetectAIve: 정밀한 기계 생성 감지 도구 |
일반 대중에 대한 대규모 언어 모델(LLM)의 광범위한 접근성으로 인해 기계 생성 텍스트(MGT)의 보급이 크게 확대되었습니다. |
| 2024년 8월 8일 |
ToolSandbox: LLM 도구 사용 기능을 상태 저장, 대화형, 대화형 평가 벤치마크 |
최근 LLM(대형 언어 모델)의 발전으로 인해 도구 사용 기능에 대한 포괄적인 평가가 필요한 실제 문제를 해결하는 도구 지원 LLM에 대한 연구 관심이 높아졌습니다. |
| 2024년 8월 7일 |
WalledEval: 호환 버전을 호환하는 보안 평가 도구 |
WalledEval은 LLM(대형 언어 모델)을 평가하도록 설계된 포괄적인 AI 안전 테스트 툴킷입니다. |
| 2024년 8월 6일 |
LLaVA-OneVision: 손쉬운 참조 작업 전송 |
LLaVA-NeXT 블로그 시리즈에서는 데이터, 모델 및 시각적 표현에 대한 통찰력을 통합하여 개발된 개방형 대형 다중 모드 모델(LMM) 제품군인 LLaVA-OneVision을 소개합니다. |
| 2024년 8월 6일 |
LLM 테스트 시간을 집중시키는 것보다 특수하게 확장하는 것보다 더 다양한 작업을 수행할 수 있습니다. |
더 많은 테스트 시간 계산을 사용하여 LLM이 출력을 향상할 수 있도록 하는 것은 개방형 자연 언어에서 작동할 수 있는 일반적으로 자체 개선 에이전트를 구축하는 데 중요한 단계입니다. |
| 2024년 8월 6일 |
StructEval: 구조적 평가를 통해 독점적인 언어 모델 평가를 촉진하고 확대 |
평가는 대규모 언어 모델 개발의 지휘봉입니다. |
| 2024년 8월 6일 |
LLM에서 강력한 텍스트-SQL 데이터 분석을 수행합니다. |
오픈 소스와 폐쇄 소스 LLM(대형 언어 모델) 간의 기능 격차는 텍스트-SQL 작업에서 여전히 과제로 남아 있습니다. |
| 2024년 8월 5일 |
독학평가자 |
모델 기반 평가는 훈련에 대한 보상 모델이자 인간 평가를 대체하는 성공적인 모델 개발의 핵심입니다. |
| 2024년 8월 5일 |
언어 모델은 말하는 동안들을 할 수 있습니다 |
대화는 인간-컴퓨터 상호작용(HCI)의 가장 자연스러운 방식입니다. |
| 2024년 8월 3일 |
MiniCPM-V: 휴대전화의 GPT-4V 고급 MLLM |
최근 MLLM(Multimodal Large Language Models)의 급증은 AI 연구 및 산업의 지형을 근본적으로 재편하여 다음 AI 이정표를 향한 유망한 길을 밝혀주었습니다. |
| 2024년 8월 2일 |
POA: 모든 크기의 모델에 대해 한 번 사전 학습 |
대규모 자체 감독 사전 훈련을 통해 하나의 기초 모델이 다양한 비전 작업을 처리할 수 있는 기반이 마련되었습니다. |
| 2024년 8월 1일 |
Medical SAM 2: Segment Anything Model 2를 통해 의료 이미지를 비디오로 저장 |
본 논문에서는 SAM 2 프레임워크를 활용하여 2D 및 3D 의료 영상 분할 작업을 모두 처리하는 고급 분할 모델인 Medical SAM 2(MedSAM-2)를 소개합니다. |
| 2024년 8월 1일 |
SAM 2: 이미지와 동영상의 모든 항목 분할 |
이미지와 비디오의 신속한 시각적 분할 문제를 해결하기 위한 기반 모델인 SAM 2(Segment Anything Model 2)를 제시합니다. |
| 2024년 8월 1일 |
다양한 언어 모델의 텍스트 삽입 개선을 통해 반대되는 반응을 사용하는 것 |
대규모 언어 모델은 자연어 이해에 있어 놀라운 성능을 보여주지만 리소스 집약적인 특성으로 인해 접근성이 떨어집니다. |
| 2024년 8월 1일 |
쌍방향 검색을 하는 상황 내 예시 선택으로 저자원 기계 번역 개선 |
상황 내 학습을 수행하는 생성적 대형 언어 모델(LLM)의 능력으로 인해 다양한 자연어 처리 작업에 대한 모델을 가장 잘 표현하는 방법에 대한 대규모 연구가 발생했습니다. |
| 2024년 8월 1일 |
문장별 요약: LM Knowledge Distillation을 사용한 작업, 데이터 조각 세트 및 엔드투엔드 모형 |
본 논문에서는 음성 문서에서 문장별로 텍스트 요약을 생성하는 문장별 음성 요약(Sen-SSum)이라는 새로운 접근 방식을 소개합니다. |