| 2024년 9월 30일 |
MM1.5: 멀티미디어 LLM 신호를 분석하는 방법, 분석 및 정보 활용 |
텍스트가 풍부한 이미지 이해, 시각적 참조 및 접지, 다중 이미지 추론 기능을 향상하도록 설계된 새로운 다중 모드 대형 언어 모델(MLLM) 제품군인 MM1.5를 소개합니다. |
| 2024년 9월 26일 |
MIO: 다중 모드의 기본 모델 |
본 논문에서는 엔드투엔드 자동 회귀 방식으로 음성, 텍스트, 이미지 및 비디오를 이해하고 생성할 수 있는 멀티모달 토큰을 기반으로 구축된 새로운 기반 모델인 MIO를 소개합니다. |
| 2024년 9월 26일 |
MaskLLM: 기증용 악기를 학습하는 반구조적 희소성 |
LLM(대형 언어 모델)은 대규모 매개변수 수로 구별되며 일반적으로 상당한 중복성을 초래합니다. |
| 2024년 9월 25일 |
Molmo 및 PixMo: 최신 최대 모드 모델을 재생하고 표시 데이터를 표시합니다. |
오늘날 가장 발전된 다중 모드 모델은 여전히 독점적입니다. |
| 2024년 9월 25일 |
VPTQ: 호환 언어 모델을 구별하는 유니버스 비트 벡터 훈련 후 모양 |
확장 모델 크기는 LLM(대형 언어 모델)의 배포 및 추론에 큰 어려움을 줍니다. |
| 2024년 9월 24일 |
Time-MoE: 전문가가 뒤에서 응원하는 크기의 시계열 기본 모델 |
시계열 예측을 위한 딥 러닝은 지난 수십 년 동안 상당한 발전을 이루었습니다. |
| 2024년 9월 23일 |
범위의 o1 예비 연구: 우리는 AI 의사에 더 가까워지는 것인가요? |
LLM(대형 언어 모델)은 다양한 영역과 작업에 걸쳐 놀라운 기능을 보여주어 학습과 인지에 대한 지식의 경계를 넓혀왔습니다. |
| 2024년 9월 21일 |
이에 따른 우려사항 |
명령어 조정은 일반적으로 명령어-응답 쌍에 대한 언어 모델을 미세 조정하는 것을 의미합니다. |
| 2024년 9월 20일 |
자신의 모습을 상상해 보세요: 쓸모 없는 개인 이미지 생성 |
확산 모델은 다양한 이미지 간 작업에서 놀라운 효율성을 보여주었습니다. |
| 2024년 9월 19일 |
강화 학습을 통해 자체 수정을 지원하는 언어 모델 교육 |
자체 수정은 대규모 언어 모델(LLM)의 매우 바람직한 기능이지만 최신 LLM에서는 대체로 효과가 없는 것으로 일관되게 밝혀졌습니다. |
| 2024년 9월 19일 |
스마트한 축소형: 휴대용 모델로 표시 모양 모델 사전 편집 훈련 |
언어 모델의 사전 훈련 단계는 종종 무작위로 초기화된 매개변수로 시작됩니다. |
| 2024년 9월 18일 |
Qwen2.5-Coder 기술상담 |
이 보고서에서는 이전 제품인 CodeQwen1.5에서 크게 업그레이드된 Qwen2.5-Coder 시리즈를 소개합니다. |
| 2024년 9월 18일 |
LLM의 긴 확장 확장 및 일반화에 대한 통제된 연구 |
광범위한 텍스트 이해와 맥락 내 학습에는 전체 문서 컨텍스트를 활용하는 언어 모델이 필요합니다. |
| 2024년 9월 18일 |
LLM + 나비소나 플러그 = 소속된 LLM |
동일한 요구 사항을 가진 사용자는 개인의 관심 사항에 따라 다양한 출력을 선호할 수 있으므로 개인화는 수많은 언어 작업 및 응용 프로그램에서 중요한 역할을 합니다. |
| 2024년 9월 17일 |
NVLM: 개방형 프론티어급 다수 수정 LLM |
선도적인 독점 모델(예: GPT-4o) 및 개방형 액세스 모델(예: Llama 3-V 405B 및 InternVL 2)과 경쟁하면서 비전 언어 작업에 대한 최첨단 결과를 달성하는 최첨단 다중 모드 대형 언어 모델(LLM) 제품군인 NVLM 1.0을 소개합니다. |
| 2024년 9월 17일 |
프롬트리버: 기후 훈련을 목적으로 검색하는 사용자의 언어 모델처럼 행동을 표시할 수 있음 |
LM(명령 조정 언어 모델)은 명령형 명령에 응답할 수 있어 기본 모델에 비해 더 자연스러운 사용자 인터페이스를 제공합니다. |
| 2024년 9월 17일 |
나만의 조정 가능한 멋진 프로그램 모델의 종합 평가: 최대 405B까지의 실험 분석 |
이전 연구 작업에서는 복잡성이나 몇 가지 기본 지식 작업 및 오래된 데이터 세트와 같은 제한된 측정항목을 사용하여 양자화된 LLM을 평가했습니다. |
| 2024년 9월 16일 |
RetrievalAttention: 벡터 검색을 장기 설명 LLM 보존 보존 |
Transformer 기반 LLM(대형 언어 모델)이 점점 더 중요해지고 있습니다. |
| 2024년 9월 16일 |
콜모고로프-아놀드 변압기 |
Transformer는 현대 딥러닝의 초석입니다. |
| 2024년 9월 16일 |
사고를 치다 |
단일 모델 내에서 방향성 비순환 그래프(DAG)를 구성하여 대규모 언어 모델(LLM)의 반복 추론을 모델링하는 프레임워크인 사고 다이어그램(DoT)을 소개합니다. |
| 2024년 9월 12일 |
DSBench: 데이터 과학자 에이전트가 데이터 전문가가 되려면 어떻게 해야 할까요? |
LLM(대형 언어 모델) 및 LVLM(대형 비전-언어 모델)은 인상적인 언어/비전 추론 능력을 보여주어 쇼핑 도우미 또는 AI 소프트웨어 엔지니어와 같은 대상 애플리케이션을 위한 에이전트를 구축하는 최근 추세를 촉발시켰습니다. |
| 2024년 9월 10일 |
PingPong: 사용자 에뮬레이션 및 다중 모델 평가를 위한 권위 있는 롤플레잉 마크 모델을 지원하는 벤치 |
언어 모델의 역할 수행 기능을 평가하기 위한 새로운 벤치마크를 소개합니다. |
| 2024년 9월 10일 |
LLaMA-Omni: 일치하는 언어 모델과의 지문인식 기능 |
GPT-4o와 같은 모델은 음성을 통해 LLM(대형 언어 모델)과 실시간 상호 작용을 가능하게 하여 기존 텍스트 기반 상호 작용에 비해 사용자 경험을 크게 향상시킵니다. |
| 2024년 9월 10일 |
마우스형 모델이 새로운 흥미 연구 아이디어를 가져올 수 있습니까? |
"아이디어는 오래된 요소들의 새로운 조합에 지나지 않습니다."(Young, J.W.) |
| 2024년 9월 9일 |
SongCreator: 가사 기반 유니버설 송 생성 |
음악은 인간 문화의 필수적인 부분으로 인간의 지능과 창의성을 구현하며 노래는 필수적인 부분을 구성합니다. |
| 2024년 9월 9일 |
HyperAgent: 코딩 작업을 처리하기 일반 소프트웨어 엔지니어링 에이전트 |
LLM(대형 언어 모델)은 소프트웨어 엔지니어링(SE)에 혁명을 일으켜 다양한 코딩 작업에서 놀라운 기능을 보여줍니다. |
| 2024년 9월 9일 |
MemoRAG: 메모리 기반 지식 발견을 통해 RAG로 노력기 |
RAG(검색 증강 생성)는 검색 도구를 활용하여 외부 데이터베이스에 액세스함으로써 최적화된 컨텍스트를 통해 LLM(대형 언어 모델)의 생성 품질을 향상시킵니다. |
| 2024년 9월 8일 |
OneGen: LLM을 효율적으로 사용하기 위한 효율적인 통합 생성 및 검색 |
다양한 NLP 작업에 대한 생성 기능을 크게 향상시킨 LLM(대형 언어 모델)의 최근 발전에도 불구하고 LLM은 여전히 검색 작업을 직접 처리하는 데 한계에 직면해 있습니다. |
| 2024년 9월 6일 |
Paper Copilot: 잃어버린 지원을 스스로 발전시키는 효율적인 LLM 시스템 |
과학 연구가 확산됨에 따라 연구자들은 방대한 양의 문헌을 탐색하고 읽는 어려운 작업에 직면해 있습니다. |
| 2024년 9월 5일 |
풍선 모델 역할에 주목: 설문 조사 |
ChatGPT가 등장한 이후 LLM(대형 언어 모델)은 다양한 작업에서 탁월한 성능을 발휘했지만 여전히 블랙박스 시스템으로 남아 있습니다. |
| 2024년 9월 5일 |
귀하의 코드 LLM은 어떻게 수행됩니까? |
최근에는 더 나은 코드 명령어 튜닝 데이터를 구성하는 방법에 대한 연구에 대한 관심이 높아지고 있습니다. |
| 2024년 9월 5일 |
MOOC에서 MAIC로: LLM 기반 에이전트를 통한 온라인 교육 및 학습 재구성 |
접근 가능하고 공유되는 온라인 플랫폼에 코스가 업로드된 최초의 온라인 교육 사례 이후, 더 많은 청중에게 다가가기 위해 인간 지식의 보급을 확장하는 이러한 형태는 광범위한 토론과 광범위한 채택을 촉발시켰습니다. |
| 2024년 9월 4일 |
LongCite: LLM을 사용하여 Long-context QA에서 별도로 생성됩니다. |
현재의 긴 맥락의 대형 언어 모델(LLM)은 광범위한 텍스트를 기반으로 사용자 질문에 답변하는 데 인상적인 능력을 보여주었지만 응답에 인용이 부족하여 사용자 확인이 어렵고 잠재적인 환각으로 인해 신뢰성에 대한 우려가 있습니다. |
| 2024년 9월 4일 |
LongLLaVA: 하이브리드를 통해 다중 모드 LLM을 1000개 이미지로 활용 가능 확장 |
MLLM(Multi-modal Large Language Models)의 긴 컨텍스트 기능을 확장하는 것은 비디오 이해, 고해상도 이미지 이해 및 다중 모드 에이전트에 매우 중요합니다. |
| 2024년 9월 4일 |
비동기 언어 모델을 선호하는 학습자의 통합된 USB 포트에 연결하여: 응답 참여 |
LLM(대형 언어 모델)은 놀라울 정도로 강력한 기능을 제공합니다. |
| 2024년 9월 4일 |
다회전 반복 학습으로 항체 구축 |
최근 연구에 따르면 코드 해석기와 같은 외부 도구를 통합하고 다중 회전 CoT(사고 사슬) 추론을 사용하면 대규모 언어 모델(LLM)의 수학적 문제 해결 기능이 향상될 수 있는 것으로 나타났습니다. |
| 2024년 9월 3일 |
OLMoE: 개방형 전문가 편집 언어 모델 |
희박한 MoE(Mixture-of-Experts)를 활용하는 완전 개방형 최첨단 언어 모델인 OLMoE를 소개합니다. |
| 2024년 9월 2일 |
GenAgent: 자동화된 작업을 생성하여 함께 AI 시스템 구축 - ComfyUI 시범 연구 |
이전의 많은 AI 연구는 특정 작업의 성능을 향상시키는 일차적인 목표를 가지고 지능과 기능을 극대화하기 위해 모놀리식 모델을 개발하는 데 중점을 두었습니다. |
| 2024년 9월 2일 |
VideoLLaMB: 협의 메모리 다리를 광범위하게 사용하는 컨텍스트 비디오 이해 |
대규모 비디오 언어 모델의 최근 발전은 실시간 계획 및 세부 상호 작용에 대한 상당한 잠재력을 보여주었습니다. |
| 2024년 9월 1일 |
ContextCite: 사진 생성을 컨텍스트에 귀속 |
언어 모델은 응답을 생성할 때 컨텍스트로 제공된 정보를 어떻게 사용합니까? |
| 2024년 8월 31일 |
LongRecipe: 해당 언어 모델에서 효율적인 긴 컨텍스트 일반화를 일하는 직원 |
LLM(대형 언어 모델)은 사전 훈련 중에 유효 컨텍스트 창 크기가 제한되어 확장된 시퀀스에 대한 일반화 기능이 제한되기 때문에 긴 컨텍스트 작업을 처리하는 데 심각한 문제에 직면합니다. |
| 2024년 8월 29일 |
Mini-Omni: 언어 모델은 스트리밍으로 생각하면서 듣고 말할 수 있습니다 |
최근 언어 모델의 발전은 상당한 진전을 이루었습니다. |
| 2024년 8월 29일 |
Jina-ColBERT-v2: 범용 다국어 나노복합 검색기 |
ColBERT와 같은 다중 벡터 밀도 모델은 정보 검색에 매우 효과적인 것으로 입증되었습니다. |
| 2024년 8월 28일 |
CoRe: 텍스트-이미지 개인화를 선택하는 정통 텍스트 임베딩 학습 |
최근 텍스트-이미지 개인화의 발전으로 사용자가 제공한 컨셉에 맞게 고품질의 제어 가능한 이미지 합성이 가능해졌습니다. |
| 2024년 8월 28일 |
SciLitLLM: 수학 문헌 이해를 위해 LLM을 적용하는 방법 |
과학 문헌에 대한 이해는 목표 정보를 추출하고 통찰력을 얻어 과학적 발견을 크게 발전시키는 데 매우 중요합니다. |