MM LLM 소개

Applied LLMs - 2024-05-03T122206.505.png

1.

OpenAI의 Sora가 2024년 2월에 데뷔하여 실감나는 동영상을 원활하게 제작했을 때 대부분의 사람들은 놀라울 정도로 깊은 인상을 받았습니다.

모든 다중 모드 시스템이 MLLM인 것은 아니라는 점에 유의하는 것이 중요합니다.

MLLM의 또 다른 주목할만한 사례는 GPT 시리즈의 언어 처리 기능과 이미지 이해 기능을 결합한 OpenAI의 GPT-4(Vision)입니다.

MLLM의 적용은 광범위하고 다양합니다.

이러한 예 외에도 MLLM은 의료, 교육, 엔터테인먼트, 자율 시스템을 비롯한 다양한 산업과 영역을 개선할 수 있는 잠재력을 가지고 있습니다.

이 초보자 친화적인 가이드의 다음 섹션에서는 MLLM의 핵심 구성 요소, 교육 패러다임, 최첨단 발전, 평가 방법, 과제 및 미래 방향을 탐색하고 이 획기적인 기술의 흥미로운 가능성과 의미를 조명합니다.

2.

Screenshot 2024-05-02 at 12.06.29 PM.png

이미지 출처: https://arxiv.org/pdf/2401.13601

대부분의 MM-LLM은 주요 구성 요소로 분류될 수 있으며 각 구성 요소는 특정 설계 선택에 따라 차별화됩니다.

2.1 모달리티 인코더

ME(Modality Encoder)는 다양한 양식의 입력을 해당 기능 표현으로 인코딩하여 MM-LLM에서 중추적인 역할을 합니다.

2.2 입력 프로젝터

다양한 양식의 입력이 기능 표현으로 인코딩되면 입력 프로젝터가 작동하게 됩니다.

2.3 LLM 백본

MM-LLM의 핵심에는 다양한 양식의 표현을 처리하고 입력에 대한 의미론적 이해, 추론 및 의사 결정에 참여하는 언어 모델 백본이 있습니다.

2.4 출력 프로젝터

출력 프로젝터는 LLM 백본과 모달리티 생성기 사이의 브리지 역할을 하며 LLM 백본의 신호 토큰 표현을 모달리티 생성기가 이해할 수 있는 기능으로 매핑합니다.

2.5 양식 생성기

마지막으로 Modality Generator는 정렬된 텍스트 표현을 기반으로 별도의 양식으로 출력을 생성하는 역할을 합니다.

2.1 작업 예:

아래 이미지에 표시된 대로 이미지 및 텍스트 설명의 입력을 바탕으로 멀티미디어 콘텐츠에 대한 캡션을 생성하는 사용 사례에서 이러한 모든 구성 요소가 어떻게 함께 작동하는지 이해해 보겠습니다.

Screenshot 2024-05-02 at 12.21.46 PM.png

각 구성요소의 작동 방식은 다음과 같습니다.

  1. 모달리티 인코더:
    • 마찬가지로 텍스트 설명은 LLM의 언어 인코더를 사용하여 인코딩됩니다.
  2. 입력 프로젝터:
    • 이러한 정렬을 통해 LLM 백본에 의한 추가 처리를 위해 이미지 기능이 텍스트 기능과 호환됩니다.
    • Cross-attention과 같은 방법을 사용하여 다양한 양식의 기능을 효과적으로 정렬할 수 있습니다.
  3. LLM 백본:
    • 주어진 이미지와 텍스트에 대한 캡션을 생성하기 위해 의미론적 이해와 추론을 수행합니다.
    • 이 구성 요소는 두 양식의 정보를 통합하여 일관되고 상황에 맞는 캡션을 생성합니다.
  4. 출력 프로젝터:
    • 이 매핑을 통해 생성된 캡션이 Modality Generator가 멀티미디어 콘텐츠를 생성하도록 안내할 수 있는 기능으로 변환됩니다.
  5. 양식 생성기:
    • 이러한 입력을 기반으로 Modality Generator는 생성된 캡션에 해당하는 멀티미디어 콘텐츠를 합성합니다.
    • 합성된 멀티미디어 콘텐츠는 텍스트 설명과 일치하며 주어진 입력에 해당하는 이미지, 비디오 또는 오디오를 포함할 수 있습니다.

3.

MM-LLM 교육에는 일반적으로 LLM 교육과 유사한 2단계가 포함됩니다.

3.1 사전 훈련(MM-PT):

MM-LLM의 사전 학습 단계에서 모델은 현재 작업에 따라 이미지와 텍스트, 오디오와 텍스트, 비디오와 텍스트 또는 기타 조합과 같은 다양한 양식의 쌍으로 구성된 방대한 데이터 세트를 접하게 됩니다.

사전 훈련을 통해 MM-LLM은 각 양식에서 특징을 추출하고 이를 병합하여 응집력 있는 표현을 생성하는 기능을 획득합니다.

일반적으로 세 가지 기본 유형의 데이터가 활용됩니다.

  1. 금 쌍: 이 범주에는 양식 쌍이 ​​해당 텍스트 설명과 연관되어 있는 정확한 일치 데이터가 포함됩니다.
  2. 인터리브된 쌍: 두 번째 유형은 양식과 텍스트를 포함하는 인터리브된 문서로 구성됩니다.
  3. 텍스트 전용: 또한 기본 사전 학습된 언어 모델의 언어 이해 기능을 유지하고 강화하기 위해 텍스트 전용 데이터가 학습 프로세스에 통합됩니다.

이 문서의 아래 표에는 널리 사용되는 학습 데이터 세트와 크기 목록이 나와 있습니다.

Screenshot 2024-05-03 at 10.55.00 AM.png

3.2 명령어 튜닝(MM-IT):

MM-LLM의 명령어 조정 단계에서 모델은 특정 작업을 수행하도록 미세 조정됩니다.

입력 데이터와 함께 명시적인 지침을 제공합니다.

  1. 작업 공식화: 처음에는 작업이 공식화되며, 이 경우에는 VQA입니다.
  2. 명령 템플릿: 입력 데이터를 처리하는 방법에 대한 지침을 모델에 제공하기 위해 다양한 지침 템플릿이 사용됩니다.
  3. "" 이미지를 검토하고 간단한 대답으로 다음 질문에 응답하십시오. "{Question}. Answer:";
  4. 특정 데이터세트 미세 조정: MM-LLM은 선택한 지침 템플릿에 따라 구조화된 작업별 데이터세트를 사용하여 미세 조정됩니다.
  5. 인간 피드백을 통한 강화 학습(RLHF): 미세 조정 후 RLHF를 사용하여 모델 성능을 더욱 향상시킵니다.

따라서 MM-LLM의 명령 조정 단계에는 작업별 데이터 세트에 대한 모델을 미세 조정하는 동시에 학습 프로세스를 안내하기 위한 명시적인 지침과 피드백을 제공하여 궁극적으로 원하는 작업을 수행하는 모델의 능력을 향상시키는 작업이 포함됩니다.

4.

Screenshot 2024-05-02 at 12.06.06 PM.png

이미지 출처: https://arxiv.org/pdf/2401.13601

위 이미지에는 인기 있는 SoTA MM-LLM이 나열되어 있습니다.

  1. 지원되는 형식: MM-LLM은 텍스트, 이미지, 오디오, 비디오 등과 같은 다양한 형식을 지원할 수 있습니다.
  2. 아키텍처 설계: MM-LLM은 다양한 아키텍처 설계를 사용하여 다중 모드 입력을 통합하고 처리합니다.
  3. 리소스 효율성: 효율성은 계산 요구 사항, 모델 크기 및 메모리 공간 측면에서 MM-LLM마다 다릅니다.
  4. 작업별 기능: MM-LLM은 시각적 질문 답변, 이미지 캡션, 대화 생성 또는 교차 모드 검색과 같은 특정 작업 또는 영역에 맞게 맞춤화될 수 있습니다.
  5. 전이 학습 및 미세 조정: 모델은 전이 학습 및 미세 조정에 대한 접근 방식이 다를 수 있습니다.
  6. 벤치마크 성능: 벤치마크 데이터 세트 및 작업의 성능은 MM-LLM마다 다를 수 있습니다.

특정 사용 사례에 적합한 MM-LLM을 선택하려면 다음과 같은 요소를 고려하세요.

  • 작업 요구 사항: MM-LLM이 사용될 특정 작업이나 애플리케이션을 식별합니다.
  • 양식: 데이터와 관련된 양식(예: 텍스트, 이미지, 오디오)을 결정하고 해당 양식을 지원하는 모델을 선택합니다.
  • 성능 측정항목: 관련 벤치마크의 정확도, F1 점수, BLEU 점수 등 작업과 관련된 측정항목에 대한 모델 성능을 평가합니다.
  • 리소스 제약: 일부 모델은 다른 모델보다 리소스 효율적일 수 있으므로 배포에 사용할 수 있는 계산 리소스를 고려하세요.

5.

MM-LLM은 다양한 측정항목과 방법론을 사용하여 평가하여 다양한 작업과 데이터 세트에서 성능을 평가할 수 있습니다.

  1. 작업별 측정항목: MM-LLM이 설계된 작업에 따라 특정 평가 측정항목을 사용할 수 있습니다.
  2. 이미지 캡션: BLEU, METEOR 또는 CIDEr와 같은 측정항목을 사용하여 생성된 캡션의 품질을 사람이 작성한 참조와 비교하여 평가할 수 있습니다.
  3. 음성 인식: WER(단어 오류율) 또는 CER(문자 오류율)과 같은 측정항목은 일반적으로 모델에서 생성된 텍스트 변환의 ​​정확성을 평가하는 데 사용됩니다.
  4. 교차 모드 검색: 평균 평균 정밀도(MAP) 또는 Recall@K와 같은 평가 측정항목을 사용하여 다양한 양식에서 관련 콘텐츠를 검색하는 모델의 성능을 측정할 수 있습니다.
  5. 인간 평가: 인간 심사위원은 주관적인 평가를 통해 MM-LLM에서 생성된 결과물의 품질을 평가할 수 있습니다.
  6. 제로샷 또는 퓨샷 학습: MM-LLM은 작업별 교육 데이터를 최소화하거나 전혀 사용하지 않고도 작업을 수행하는 능력을 평가할 수도 있습니다.
  7. 적대적 평가: 적대적 예나 스트레스 테스트를 사용하여 입력 교란이나 적대적 공격에 대한 MM-LLM의 견고성을 평가할 수 있습니다.
  8. 다운스트림 작업 성능: MM-LLM은 다중 모드 표현을 활용하여 성능을 향상시킬 수 있는 이미지 분류, 텍스트 생성 또는 감정 분석과 같은 다운스트림 작업의 성능을 평가하는 경우가 많습니다.
  9. 전이 학습 성능: MM-LLM의 표현이 다른 작업이나 도메인으로 얼마나 잘 전달되는지에 대한 평가도 수행할 수 있으며, 이는 모델이 여러 양식에 걸쳐 유용하고 일반화 가능한 표현을 학습하는 능력을 나타냅니다.

6.

MM-LLM은 연구 발전과 실제 응용 분야 모두에서 엄청난 잠재력을 갖고 빠르게 성장하는 분야를 대표합니다.

탐구해야 할 몇 가지 유망한 방향은 다음과 같습니다.

  1. 더 강력해진 모델:
    • LLM 다양화: 다양한 유형과 규모의 LLM을 통합하면 실무자가 특정 요구 사항에 가장 적합한 모델을 선택할 수 있는 유연성을 얻을 수 있습니다.
    • MM IT(명령 튜닝) 데이터 세트 품질 개선: MM IT 데이터 세트의 명령어 다양성을 향상하면 MM-LLM의 사용자 명령 이해 및 실행이 향상될 수 있습니다.
    • MM 생성 기능 강화: 많은 MM-LLM이 MM 이해에 중점을 두는 반면 검색 기반 접근 방식을 통해 MM 생성 기능을 개선하면 전반적인 성능을 향상시킬 수 있습니다.
  2. 더 까다로운 벤치마크:
    • GOAT-Bench, MathVista, MMMU 및 BenchLMM과 같은 벤치마크를 도입하여 다양한 작업 및 양식에 걸쳐 MM-LLM의 기능을 평가합니다.
  3. 모바일/경량 배포:
  4. 도메인 지식과의 통합:
  5. 체화된 지능:
  6. 다국어 및 교차 언어 기능:
  7. 개인정보 보호 및 보안:
  8. 설명 가능성 및 해석 가능성:
  9. 지속적인 학습:
  • 지속적인 학습(CL)은 MM-LLM이 높은 재교육 비용을 피하면서 새로운 데이터를 효율적으로 활용하는 데 중요합니다.
  1. 환각 완화:

참고자료:

  1. MM-LLM: 다중 모달 대형 언어 모델의 최근 발전(링크)
  2. MM1: 다중 모드 LLM 사전 교육의 방법, 분석 및 통찰력(링크)
  3. https://github.com/BradyFU/Awesome-Multimodal-Large-Language-Models
  4. 다중 모드 대형 언어 모델에 대한 설문 조사(링크)