제목 추상적인
2024년 12월 26일 작업 선호도 최적화: 작업 방향을 전환하여 다중 모드 대형 언어 모델 개선 현재의 다중 모드 대형 언어 모델(MLLM)은 다양한 비전 애플리케이션에서 포괄적인 인식과 추론을 제공하지만 시각적인 부분을 세밀하고 정확하게 이해하는 데 어려움을 겪고 있습니다.
2024년 12월 24일 Video-Panda: 소수가 없는 Video 언어 모델을 선택적으로 선택하기 우리는 계산 오버헤드를 크게 줄이면서 경쟁력 있는 성능을 달성하는 비디오 언어 이해를 위한 효율적인 인코더 없는 접근 방식을 제시합니다.
2024년 12월 24일 Mulberry: 친구들카를로 트리 검색을 시도 o1과 인사 및 성찰로 MLLM 역량 강화 본 연구에서는 최종 답변까지 추론의 각 중간 단계를 생성하는 방법을 학습하여 질문을 이해하고 해결하는 MLLM을 개발하는 것을 목표로 합니다.
2024년 12월 23일 YuLan-Mini: 개방형 데이터 효율적인 언어 모델 대규모 언어 모델(LLM)의 효과적인 사전 훈련은 막대한 리소스 수요와 관련된 기술 프로세스의 복잡성으로 인해 어려웠습니다.
2024년 12월 19일 Qwen2.5 기술정보 이 보고서에서는 다양한 요구 사항을 충족하도록 설계된 포괄적인 LLM(대형 언어 모델) 시리즈인 Qwen2.5를 소개합니다.
2024년 12월 19일 RobustFT: 시끄러운 응답 하에서 권위 있는 언어 모델을 제공하는 감독 감사합니다 SFT(감독 미세 조정)는 LLM(대형 언어 모델)을 특정 도메인이나 작업에 적용하는 데 중요한 역할을 합니다.
2024년 12월 19일 능동 검색을 하려고 합니다. 다단계 다중 모드 추론 작업은 다중 모드 대형 언어 모델(MLLM)에 중요한 과제를 제기하며 이러한 시나리오에서 성능을 향상시키는 효과적인 방법을 찾는 것은 아직 해결되지 않은 문제로 남아 있습니다.
2024년 12월 19일 Agent-SafetyBench: LLM 에이전트의 보호 평가 LLM(대형 언어 모델)이 점점 에이전트로 배포됨에 따라 대화형 환경과 도구 사용에 대한 통합으로 인해 모델 자체와 관련된 문제를 넘어서는 새로운 안전 문제가 발생합니다.
2024년 12월 18일 TheAgentCompany: 효과적인 실제 작업에 대한 LLM 에이전트 벤치마킹 우리는 일상 생활에서든 직장에서든 매일 컴퓨터와 상호 작용하며, 업무의 여러 측면은 전적으로 컴퓨터와 인터넷에 대한 액세스를 통해 수행할 수 있습니다.
2024년 12월 18일 더 스마트하고, 더 많은 내용, 더 빠르고, 더 오래: 더 빠른 메모리를 제공하는 것은 더 긴 후속 조치 및 적용을 최신 버전으로 포함합니다. BERT와 같은 인코더 전용 변환기 모델은 더 큰 디코더 전용 모델과 관련하여 검색 및 분류 작업에 대해 뛰어난 성능 크기 절충안을 제공합니다.
2024년 12월 18일 범위: 긴 컨텍스트 생성에서 키-값 캐시 압축 최적화 KV(키-값) 캐시는 긴 컨텍스트 생성을 위한 LLM의 병목 현상이 되었습니다.
2024년 12월 17일 귀사의 LLM은 사용할 수 있습니까? LLM(대형 언어 모델)의 급속한 발전은 복잡한 추론 작업에서 놀라운 발전을 보여주었습니다.
2024년 12월 17일 OmniEval: 금융 자격의 전방향 자동 RAG 평가 벤치마크 LLM(대형 언어 모델)의 일반적이고 실용적인 응용 프로그램인 RAG(검색 증강 생성) 기술은 특히 LLM에 도메인별 지식이 부족할 수 있는 수직 도메인에서 광범위한 주목을 받았습니다.
2024년 12월 16일 RetroLLM: 세대 내에서 구별되는 증거를 검색할 수 있도록 허용하는 언어 모델 지원 LLM(대형 언어 모델)은 놀라운 생성 능력을 보이지만 종종 환각에 시달립니다.
2024년 12월 16일 다수의 인텔리전을 고려하여 예측됩니다: 복합적인 조사 자연어 처리의 언어 모델링 기반을 바탕으로 NTP(Next Token Prediction)는 다양한 양식에 걸쳐 기계 학습 작업을 위한 다목적 교육 목표로 발전하여 상당한 성공을 거두었습니다.
2024년 12월 13일 Apollo: 다수의 동영상 비디오 이해 추구 LMM(Large Multimodal Model)에 비디오 인식 기능이 빠르게 통합되었음에도 불구하고 비디오 이해를 촉진하는 기본 메커니즘은 아직 잘 이해되지 않은 상태입니다.
2024년 12월 13일 실행 모델: 시작부터 구현까지 AI가 계속 발전함에 따라 언어 기반 지원을 넘어 실제 작업을 수행할 수 있는 지능형 에이전트로 전환하는 시스템에 대한 수요가 증가하고 있습니다.
2024년 12월 12일 InternLM-XComposer2.5-OmniLive: 장기 스트리밍 비디오 및 오디오 삽입 결합을 통해 전체인 멀티모달 시스템 인간의 인지와 유사하게 장기간에 걸쳐 환경과 상호작용할 수 있는 AI 시스템을 만드는 것은 오랜 연구 목표였습니다.
2024년 12월 12일 Phi-4 기술 검토 우리는 데이터 품질에 중점을 둔 훈련 레시피로 개발된 140억 개의 매개변수 언어 모델인 phi-4를 제시합니다.
2024년 12월 10일 평가 대행자: 표시 생성 모델을 소장하고 가치 프레임워크 표시 최근 시각적 생성 모델의 발전으로 고품질 이미지 및 비디오 생성이 가능해졌으며 다양한 애플리케이션이 가능해졌습니다.
2024년 12월 10일 Maya: 보일러가 지원되는 다목적 파일 편집 대규모 VLM(Vision-Language Model)의 급속한 개발로 인해 주로 널리 사용되는 언어에 대한 학문적 벤치마크에서 인상적인 결과가 나왔습니다.
2024년 12월 6일 모델, 데이터 및 테스트 시간 확장을 위한 오픈소스 모달 모델의 성능 테두리 확장 InternVL 2.0을 기반으로 하는 고급 MLLM(다중 모드 대형 언어 모델) 시리즈인 InternVL 2.5를 소개합니다. InternVL 2.5는 핵심 모델 아키텍처를 유지하면서 교육 및 테스트 전략은 물론 데이터 품질이 크게 향상되었습니다.
2024년 12월 6일 인간 선호도에 따라 CodeLLM 평가 및 조정 codeLLM(코드 대규모 언어 모델)은 코드 생성에서 상당한 발전을 이루었습니다.
2024년 12월 5일 BigDocs: 문서 및 코드 작업에 대한 다양한 모델 교육을 표시 및 허용 라이센스 데이터 세트 멀티모달 AI는 영수증 처리, 워크플로우 이해, 문서에서 데이터 추출, 보고서 요약 등 문서 이해 작업을 크게 향상시킬 수 있는 잠재력을 가지고 있습니다.
2024년 12월 5일 NVILA: 효율적인 프론티어 연관 언어 모델 VLM(시각 언어 모델)은 최근 몇 년 동안 정확성이 크게 향상되었습니다.
2024년 12월 5일 VisionZip: 길이가 더 밝은 렌즈에는 필요하지 않습니다. 최근 비전 언어 모델의 발전으로 인해 시각적 토큰의 길이가 늘어나 텍스트 토큰보다 훨씬 길어지고 계산 비용이 크게 증가하여 성능이 향상되었습니다.
2024년 12월 4일 음악을 편집하는 데이터 생성으로 평가 언어 모델(LM) 사후 학습에서 합성 데이터의 사용이 증가함에 따라 고품질 데이터를 생성하는 LM의 능력은 문제를 직접 해결하는 능력만큼 중요해졌습니다.
2024년 12월 4일 PaliGemma 2: 저장 장치 VLM 제품군 PaliGemma 2는 Gemma 2 언어 모델 제품군을 기반으로 하는 PaliGemma 개방형 VLM(Vision-Language Model)의 업그레이드입니다.
2024년 12월 4일 열대우림의 특성에 대한 긍정적인 태도 및 태도에 영향을 끼치는 요인 대규모 언어 모델을 사용한 합성 데이터 생성은 거의 무한한 범위의 작업에 걸쳐 자연 데이터를 보강하기 위한 유망한 패러다임입니다.
2024년 12월 3일 VideoGen-of-Thought: 멀티샷 비디오 생성을 함께 사용하는 프레임워크 현재 비디오 생성 모델은 짧은 클립 생성에는 탁월하지만 여러 장의 영화 같은 비디오를 만드는 데 여전히 어려움을 겪고 있습니다.
2024년 12월 3일 개인화된 다양한 형태의 모델: 설문 조사 MLLM(Multimodal Large Language Model)은 최첨단 성능과 텍스트, 이미지, 오디오와 같은 여러 데이터 형식을 통합하여 복잡한 작업을 높은 정확도로 수행할 수 있는 능력으로 인해 점점 더 중요해지고 있습니다.
2024년 12월 2일 MALT: 다중 에이전트 LLM 교육을 위해 개선 LLM 간의 효과적인 협업을 활성화하는 것은 복잡한 문제를 해결할 수 있는 자율 시스템을 개발하는 데 중요한 단계입니다.
2024년 12월 2일 Yi-Lightning 기술 검토 이 기술 보고서는 당사의 최신 플래그십 대형 언어 모델(LLM)인 Yi-Lightning을 소개합니다.
2024년 11월 29일 중요한 의미는 다음과 같습니다: LLM의 의미있는 논쟁은 해결됩니다. LLM(대형 언어 모델)은 추론 작업에서 놀라운 성능을 보여왔습니다.
2024년 11월 29일 o1-Coder: 코딩을 o1 복제 기술 보고서에서는 코딩 작업에 중점을 두고 OpenAI의 o1 모델을 복제하려는 시도인 O1-CODER를 소개합니다.
2024년 11월 28일 Open-Sora 계획: 오픈 소스 비디오 생성 모델 다양한 사용자 입력을 기반으로 원하는 고해상도 영상을 장시간 생성하기 위한 대규모 모델 기여를 목표로 하는 오픈소스 프로젝트인 Open-Sora Plan을 소개합니다.