| 2024년 12월 26일 |
작업 선호도 최적화: 작업 방향을 전환하여 다중 모드 대형 언어 모델 개선 |
현재의 다중 모드 대형 언어 모델(MLLM)은 다양한 비전 애플리케이션에서 포괄적인 인식과 추론을 제공하지만 시각적인 부분을 세밀하고 정확하게 이해하는 데 어려움을 겪고 있습니다. |
| 2024년 12월 24일 |
Video-Panda: 소수가 없는 Video 언어 모델을 선택적으로 선택하기 |
우리는 계산 오버헤드를 크게 줄이면서 경쟁력 있는 성능을 달성하는 비디오 언어 이해를 위한 효율적인 인코더 없는 접근 방식을 제시합니다. |
| 2024년 12월 24일 |
Mulberry: 친구들카를로 트리 검색을 시도 o1과 인사 및 성찰로 MLLM 역량 강화 |
본 연구에서는 최종 답변까지 추론의 각 중간 단계를 생성하는 방법을 학습하여 질문을 이해하고 해결하는 MLLM을 개발하는 것을 목표로 합니다. |
| 2024년 12월 23일 |
YuLan-Mini: 개방형 데이터 효율적인 언어 모델 |
대규모 언어 모델(LLM)의 효과적인 사전 훈련은 막대한 리소스 수요와 관련된 기술 프로세스의 복잡성으로 인해 어려웠습니다. |
| 2024년 12월 19일 |
Qwen2.5 기술정보 |
이 보고서에서는 다양한 요구 사항을 충족하도록 설계된 포괄적인 LLM(대형 언어 모델) 시리즈인 Qwen2.5를 소개합니다. |
| 2024년 12월 19일 |
RobustFT: 시끄러운 응답 하에서 권위 있는 언어 모델을 제공하는 감독 감사합니다 |
SFT(감독 미세 조정)는 LLM(대형 언어 모델)을 특정 도메인이나 작업에 적용하는 데 중요한 역할을 합니다. |
| 2024년 12월 19일 |
능동 검색을 하려고 합니다. |
다단계 다중 모드 추론 작업은 다중 모드 대형 언어 모델(MLLM)에 중요한 과제를 제기하며 이러한 시나리오에서 성능을 향상시키는 효과적인 방법을 찾는 것은 아직 해결되지 않은 문제로 남아 있습니다. |
| 2024년 12월 19일 |
Agent-SafetyBench: LLM 에이전트의 보호 평가 |
LLM(대형 언어 모델)이 점점 에이전트로 배포됨에 따라 대화형 환경과 도구 사용에 대한 통합으로 인해 모델 자체와 관련된 문제를 넘어서는 새로운 안전 문제가 발생합니다. |
| 2024년 12월 18일 |
TheAgentCompany: 효과적인 실제 작업에 대한 LLM 에이전트 벤치마킹 |
우리는 일상 생활에서든 직장에서든 매일 컴퓨터와 상호 작용하며, 업무의 여러 측면은 전적으로 컴퓨터와 인터넷에 대한 액세스를 통해 수행할 수 있습니다. |
| 2024년 12월 18일 |
더 스마트하고, 더 많은 내용, 더 빠르고, 더 오래: 더 빠른 메모리를 제공하는 것은 더 긴 후속 조치 및 적용을 최신 버전으로 포함합니다. |
BERT와 같은 인코더 전용 변환기 모델은 더 큰 디코더 전용 모델과 관련하여 검색 및 분류 작업에 대해 뛰어난 성능 크기 절충안을 제공합니다. |
| 2024년 12월 18일 |
범위: 긴 컨텍스트 생성에서 키-값 캐시 압축 최적화 |
KV(키-값) 캐시는 긴 컨텍스트 생성을 위한 LLM의 병목 현상이 되었습니다. |
| 2024년 12월 17일 |
귀사의 LLM은 사용할 수 있습니까? |
LLM(대형 언어 모델)의 급속한 발전은 복잡한 추론 작업에서 놀라운 발전을 보여주었습니다. |
| 2024년 12월 17일 |
OmniEval: 금융 자격의 전방향 자동 RAG 평가 벤치마크 |
LLM(대형 언어 모델)의 일반적이고 실용적인 응용 프로그램인 RAG(검색 증강 생성) 기술은 특히 LLM에 도메인별 지식이 부족할 수 있는 수직 도메인에서 광범위한 주목을 받았습니다. |
| 2024년 12월 16일 |
RetroLLM: 세대 내에서 구별되는 증거를 검색할 수 있도록 허용하는 언어 모델 지원 |
LLM(대형 언어 모델)은 놀라운 생성 능력을 보이지만 종종 환각에 시달립니다. |
| 2024년 12월 16일 |
다수의 인텔리전을 고려하여 예측됩니다: 복합적인 조사 |
자연어 처리의 언어 모델링 기반을 바탕으로 NTP(Next Token Prediction)는 다양한 양식에 걸쳐 기계 학습 작업을 위한 다목적 교육 목표로 발전하여 상당한 성공을 거두었습니다. |
| 2024년 12월 13일 |
Apollo: 다수의 동영상 비디오 이해 추구 |
LMM(Large Multimodal Model)에 비디오 인식 기능이 빠르게 통합되었음에도 불구하고 비디오 이해를 촉진하는 기본 메커니즘은 아직 잘 이해되지 않은 상태입니다. |
| 2024년 12월 13일 |
실행 모델: 시작부터 구현까지 |
AI가 계속 발전함에 따라 언어 기반 지원을 넘어 실제 작업을 수행할 수 있는 지능형 에이전트로 전환하는 시스템에 대한 수요가 증가하고 있습니다. |
| 2024년 12월 12일 |
InternLM-XComposer2.5-OmniLive: 장기 스트리밍 비디오 및 오디오 삽입 결합을 통해 전체인 멀티모달 시스템 |
인간의 인지와 유사하게 장기간에 걸쳐 환경과 상호작용할 수 있는 AI 시스템을 만드는 것은 오랜 연구 목표였습니다. |
| 2024년 12월 12일 |
Phi-4 기술 검토 |
우리는 데이터 품질에 중점을 둔 훈련 레시피로 개발된 140억 개의 매개변수 언어 모델인 phi-4를 제시합니다. |
| 2024년 12월 10일 |
평가 대행자: 표시 생성 모델을 소장하고 가치 프레임워크 표시 |
최근 시각적 생성 모델의 발전으로 고품질 이미지 및 비디오 생성이 가능해졌으며 다양한 애플리케이션이 가능해졌습니다. |
| 2024년 12월 10일 |
Maya: 보일러가 지원되는 다목적 파일 편집 |
대규모 VLM(Vision-Language Model)의 급속한 개발로 인해 주로 널리 사용되는 언어에 대한 학문적 벤치마크에서 인상적인 결과가 나왔습니다. |
| 2024년 12월 6일 |
모델, 데이터 및 테스트 시간 확장을 위한 오픈소스 모달 모델의 성능 테두리 확장 |
InternVL 2.0을 기반으로 하는 고급 MLLM(다중 모드 대형 언어 모델) 시리즈인 InternVL 2.5를 소개합니다. InternVL 2.5는 핵심 모델 아키텍처를 유지하면서 교육 및 테스트 전략은 물론 데이터 품질이 크게 향상되었습니다. |
| 2024년 12월 6일 |
인간 선호도에 따라 CodeLLM 평가 및 조정 |
codeLLM(코드 대규모 언어 모델)은 코드 생성에서 상당한 발전을 이루었습니다. |
| 2024년 12월 5일 |
BigDocs: 문서 및 코드 작업에 대한 다양한 모델 교육을 표시 및 허용 라이센스 데이터 세트 |
멀티모달 AI는 영수증 처리, 워크플로우 이해, 문서에서 데이터 추출, 보고서 요약 등 문서 이해 작업을 크게 향상시킬 수 있는 잠재력을 가지고 있습니다. |
| 2024년 12월 5일 |
NVILA: 효율적인 프론티어 연관 언어 모델 |
VLM(시각 언어 모델)은 최근 몇 년 동안 정확성이 크게 향상되었습니다. |
| 2024년 12월 5일 |
VisionZip: 길이가 더 밝은 렌즈에는 필요하지 않습니다. |
최근 비전 언어 모델의 발전으로 인해 시각적 토큰의 길이가 늘어나 텍스트 토큰보다 훨씬 길어지고 계산 비용이 크게 증가하여 성능이 향상되었습니다. |
| 2024년 12월 4일 |
음악을 편집하는 데이터 생성으로 평가 |
언어 모델(LM) 사후 학습에서 합성 데이터의 사용이 증가함에 따라 고품질 데이터를 생성하는 LM의 능력은 문제를 직접 해결하는 능력만큼 중요해졌습니다. |
| 2024년 12월 4일 |
PaliGemma 2: 저장 장치 VLM 제품군 |
PaliGemma 2는 Gemma 2 언어 모델 제품군을 기반으로 하는 PaliGemma 개방형 VLM(Vision-Language Model)의 업그레이드입니다. |
| 2024년 12월 4일 |
열대우림의 특성에 대한 긍정적인 태도 및 태도에 영향을 끼치는 요인 |
대규모 언어 모델을 사용한 합성 데이터 생성은 거의 무한한 범위의 작업에 걸쳐 자연 데이터를 보강하기 위한 유망한 패러다임입니다. |
| 2024년 12월 3일 |
VideoGen-of-Thought: 멀티샷 비디오 생성을 함께 사용하는 프레임워크 |
현재 비디오 생성 모델은 짧은 클립 생성에는 탁월하지만 여러 장의 영화 같은 비디오를 만드는 데 여전히 어려움을 겪고 있습니다. |
| 2024년 12월 3일 |
개인화된 다양한 형태의 모델: 설문 조사 |
MLLM(Multimodal Large Language Model)은 최첨단 성능과 텍스트, 이미지, 오디오와 같은 여러 데이터 형식을 통합하여 복잡한 작업을 높은 정확도로 수행할 수 있는 능력으로 인해 점점 더 중요해지고 있습니다. |
| 2024년 12월 2일 |
MALT: 다중 에이전트 LLM 교육을 위해 개선 |
LLM 간의 효과적인 협업을 활성화하는 것은 복잡한 문제를 해결할 수 있는 자율 시스템을 개발하는 데 중요한 단계입니다. |
| 2024년 12월 2일 |
Yi-Lightning 기술 검토 |
이 기술 보고서는 당사의 최신 플래그십 대형 언어 모델(LLM)인 Yi-Lightning을 소개합니다. |
| 2024년 11월 29일 |
중요한 의미는 다음과 같습니다: LLM의 의미있는 논쟁은 해결됩니다. |
LLM(대형 언어 모델)은 추론 작업에서 놀라운 성능을 보여왔습니다. |
| 2024년 11월 29일 |
o1-Coder: 코딩을 o1 복제 |
기술 보고서에서는 코딩 작업에 중점을 두고 OpenAI의 o1 모델을 복제하려는 시도인 O1-CODER를 소개합니다. |
| 2024년 11월 28일 |
Open-Sora 계획: 오픈 소스 비디오 생성 모델 |
다양한 사용자 입력을 기반으로 원하는 고해상도 영상을 장시간 생성하기 위한 대규모 모델 기여를 목표로 하는 오픈소스 프로젝트인 Open-Sora Plan을 소개합니다. |