일반적인 생성 AI 인터뷰 질문

소유자: Aishwarya Nr

생성 모델

  1. 생성 모델과 차별 모델의 차이점은 무엇인가요?

  1. 생성적 적대 신경망(Generative Adversarial Network)의 아키텍처와 생성자와 판별자가 훈련 중에 상호 작용하는 방식을 설명합니다.

  1. VAE(Variational Autoencoder)의 개념과 잠재 변수를 아키텍처에 통합하는 방법을 설명합니다.

  1. 조건부 생성 모델은 무조건 생성 모델과 어떻게 다릅니까?

조건부 생성 모델은 추가 정보나 조건을 통합하여 생성된 출력에 대한 더 큰 유연성과 제어를 제공하므로 특정 제약 조건이나 입력 조건에 따른 맞춤형 생성이 필요한 작업에 적합합니다.


  1. GAN의 맥락에서 모드 붕괴란 무엇이며 훈련 중에 이를 해결하기 위해 어떤 전략을 사용할 수 있습니까?

  1. 생성 모델에서 과적합이 어떻게 나타나고, 훈련 중에 이를 방지하기 위해 어떤 기술을 사용할 수 있나요?

  1. 그래디언트 클리핑(Gradient Clipping)이란 무엇이며, 생성 모델의 훈련 프로세스를 안정화하는 데 어떻게 도움이 됩니까?

  1. 사용 가능한 데이터세트가 제한적인 경우 생성 모델을 훈련하기 위한 전략을 논의합니다.

  1. 생성 모델 훈련에 커리큘럼 학습이 어떻게 적용될 수 있는지 설명합니다.

  1. 학습률 스케줄링의 개념과 시간이 지남에 따라 생성 모델의 훈련 프로세스를 최적화하는 역할을 설명합니다.

  1. 생성 모델의 맥락에서 L1 및 L2 손실 함수의 사용을 비교하고 대조합니다.

  1. GAN의 맥락에서 손실 함수에서 그래디언트 페널티의 목적은 무엇입니까?

대규모 언어 모델

  1. 자연어 처리의 맥락에서 전이 학습의 개념을 논의합니다.

  1. GPT(Generative Pre-trained Transformer)와 BERT(변압기의 양방향 인코더 표현)와 같은 모델 간의 주요 차이점을 강조하시겠습니까?

  1. 변환기 모델은 RNN의 어떤 문제를 해결합니까?

  1. 변압기 모델에 상대 위치 정보를 통합하는 것이 중요한 이유는 무엇입니까?

  1. 바닐라 트랜스포머 모델의 고정되고 제한된 주의 범위로 인해 어떤 문제가 발생합니까?

  1. 순진하게 컨텍스트 길이를 늘리는 것이 변환기 모델에서 더 긴 컨텍스트를 처리하기 위한 간단한 솔루션이 아닌 이유는 무엇입니까?

  1. 셀프 어텐션은 어떻게 작동하나요?

  1. LLM에 사용되는 사전 훈련 메커니즘은 무엇이며 몇 가지를 설명하십시오.

  1. 다중 헤드 주의가 필요한 이유는 무엇입니까?

  1. RLHF란 무엇이며 어떻게 사용되나요?

  1. LLM의 맥락에서 치명적인 망각이란 무엇입니까?

  1. 변환기 기반 시퀀스-시퀀스 모델에서 인코더와 디코더의 주요 기능은 무엇입니까?

  1. 변환기 모델에서 위치 인코딩이 중요한 이유는 무엇이며 self-attention 작업의 맥락에서 어떤 문제를 해결합니까?

  1. 특정 NLP 작업을 위해 사전 훈련된 변환기를 미세 조정하기 위해 전이 학습을 적용할 때, 특히 도메인별 데이터를 처리할 때 효과적인 지식 전달을 보장하기 위해 어떤 전략을 사용할 수 있습니까?

  1. 변환기 기반 인코더-디코더 모델에서 교차 주의의 역할을 논의합니다.

  1. ****언어 모델 학습에서 희소(예: 교차 엔트로피) 및 밀집(예: 평균 제곱 오류) 손실 함수 사용의 영향을 비교하고 대조합니다.

  1. 강화 학습을 대규모 언어 모델의 훈련에 어떻게 통합할 수 있으며, RL 기반 접근 방식에 적합한 손실 함수를 선택하는 데 어떤 어려움이 발생할 수 있습니까?

다중 모드 모델(비생성 모델 포함)

1. 다중 모달 언어 모델에서 이미지 캡션이나 시각적 질문 답변과 같은 작업을 수행하기 위해 시각적 및 텍스트 양식의 정보가 어떻게 효과적으로 통합됩니까?


2. VisualBERT 또는 CLIP과 같은 모델에서 교차 모드 주의 메커니즘의 역할을 설명합니다.


3. 이미지-텍스트 일치와 같은 작업의 경우 시각적 정보와 텍스트 정보의 정렬된 쌍을 생성하기 위해 일반적으로 훈련 데이터에 주석이 어떻게 추가되며 어떤 고려 사항을 고려해야 합니까?


4. 이미지 합성을 위한 생성 모델을 학습시킬 때 생성된 이미지와 대상 이미지 간의 차이를 평가하는 데 사용되는 일반적인 손실 함수는 무엇이며 학습 과정에 어떻게 기여합니까?


5. 지각 손실이란 무엇이며 생성된 이미지와 대상 이미지 간의 지각 유사성을 측정하기 위해 이미지 생성 작업에서 어떻게 활용됩니까?


  1. 마스크된 언어-이미지 모델링이란 무엇입니까?

  1. Cross-attention 메커니즘에서 얻은 Attention 가중치는 다중 모드 모델의 생성 프로세스에 어떤 영향을 줍니까?

  1. 단일 모드 생성 모델과 비교하여 다중 모드 생성 모델을 훈련할 때 고유한 과제는 무엇입니까?

  1. 다중 모드 생성 모델은 훈련 시 데이터 희소성 문제를 어떻게 해결합니까?

  1. VLP(Vision-Language Pre-training)의 개념과 강력한 비전 언어 모델 개발에 있어서 그 중요성을 설명합니다.

  1. CLIP 및 DALL-E와 같은 모델은 비전과 언어 양식의 통합을 어떻게 보여줍니까?

  1. 주의 메커니즘은 시각 언어 모델의 성능을 어떻게 향상합니까?

임베딩

1. 기계 학습에서 임베딩의 기본 개념은 무엇이며 원시 입력 데이터에 비해 정보를 어떻게 더 간결한 형태로 표현합니까?


  1. 단어 임베딩과 문장 임베딩을 비교하고 대조합니다.

문장 삽입:

둘 중 선택 시 고려 사항:

단어 임베딩과 문장 임베딩 사이의 결정은 NLP 작업의 특정 요구 사항, 컨텍스트의 중요성, 계산 고려 사항 및 훈련 데이터의 특성에 따라 달라집니다.


  1. 상황별 임베딩의 개념을 설명하세요.

  1. 텍스트, 이미지 등 다양한 양식의 정보가 공유 임베딩 공간에 표시되는 교차 모달 임베딩 생성과 관련된 과제와 전략에 대해 논의합니다.

5. 단어 임베딩을 훈련할 때 훈련 데이터에서 발생 빈도가 제한된 희귀 단어에 대한 표현을 효과적으로 캡처하도록 모델을 어떻게 설계할 수 있습니까?


  1. 과적합을 방지하고 모델의 일반화 능력을 향상시키기 위해 임베딩 훈련 중에 사용되는 일반적인 정규화 기술에 대해 논의합니다.

7. 사전 훈련된 임베딩을 다운스트림 작업의 전이 학습에 어떻게 활용할 수 있으며, 임베딩 생성 측면에서 전이 학습이 제공하는 이점은 무엇입니까?

사전 훈련된 임베딩은 캡슐화된 일반적인 언어 또는 의미 지식을 활용하여 다운스트림 작업에서 직접 사용하거나 미세 조정할 수 있습니다.

효율성: 다운스트림 작업에서 높은 성능을 달성하는 데 필요한 데이터 및 계산 리소스의 양을 크게 줄입니다.

일반화: 크고 다양한 데이터 세트에 대해 훈련된 임베딩은 언어 또는 시각적 개념에 대한 광범위한 이해를 제공하여 모델의 일반화 능력을 향상시킵니다.

빠른 적응: 미세 조정을 통해 모델이 특정 작업에 빠르게 적응하고 개발 주기를 가속화하며 보다 유연한 애플리케이션을 활성화할 수 있습니다.


  1. 임베딩 맥락에서 양자화란 무엇이며 표현 품질을 유지하면서 모델의 메모리 공간을 줄이는 데 어떻게 기여합니까?

  1. 표 형식 데이터에서 카디널리티가 높은 범주형 특성을 처리할 때 의미 있는 표현을 캡처하기 위해 신경망을 사용하여 임베딩을 효율적으로 구현하고 훈련하는 방법은 무엇입니까?

  1. 대규모 임베딩을 처리할 때 대규모 데이터베이스에서 유사한 임베딩을 빠르게 검색할 수 있는 최근접 이웃 검색을 위한 효율적인 방법을 제안하고 구현합니다.

  1. LLM이 임베딩 생성 중에 어휘에서 벗어난 단어를 발견하는 시나리오에서는 그러한 사례를 처리하기 위한 전략을 제안하십시오.

  1. LLM에서 생성된 임베딩 품질을 정량적으로 평가하기 위한 측정항목을 제안합니다.

  1. 임베딩 학습의 맥락에서 삼중 손실의 개념을 설명합니다.

14.


훈련, 추론 및 평가

  1. 훈련 중 LLM의 과적합과 관련된 문제에 대해 논의합니다.

2. 대규모 언어 모델에는 학습률을 신중하게 조정해야 하는 경우가 많습니다.


  1. LLM을 사용하여 시퀀스를 생성할 때 긴 컨텍스트 길이를 어떻게 효율적으로 처리할 수 있습니까?

4.

  • 답변:

  • 사람 평가: 관련성, 유창성, 일관성, 전반적인 품질과 같은 기준을 바탕으로 모델 출력의 품질을 평가하기 위해 사람 평가자를 모집합니다.
  • BLEU(Bilingual Evaluation Understudy): 기계 번역 작업에 주로 사용되는 측정항목입니다.
  • ROUGE(Recall-Oriented Understudy for Gisting Evaluation): 요약의 품질을 평가하는 데 사용됩니다.
  • 다양성: 생성된 응답의 다양성과 고유성을 측정하며 종종 N-그램 다양성 또는 의미 유사성과 같은 측정항목을 사용하여 분석됩니다.
  • 진실성 평가: LLM의 진실성을 평가하려면 LLM에서 생성된 답변을 사람의 답변과 비교하고, TruthfulQA와 같은 데이터 세트에 대한 벤치마킹, LLM 숨겨진 레이어 활성화에 대한 참/거짓 분류기 학습과 같은 기술이 필요합니다.

  1. LLM의 환각은 알려진 문제입니다. 이를 어떻게 평가하고 완화할 수 있습니까?
  • 답변:

  • 길이 정규화 시퀀스 로그 확률을 활용하여 모델 출력의 신뢰도를 평가합니다.
  • 참조 기반 방법과 비교하여 번역 품질을 평가하고 환각을 감지하는 데 효과적입니다.
  • 번역 과정에서 단순성과 계산 용이성을 제공합니다.
  • 문장 유사성:
    • 생성된 번역에 대한 소스 기여도의 백분율을 평가하고 낮은 소스 기여도를 감지하여 환각을 식별합니다.
    • 문장 간의 의미 유사성 측정과 함께 참조 기반, 내부 측정 및 참조 없는 기술을 활용합니다.
    • LASER, LaBSE 및 XNLI와 같은 기술은 환각 감지 및 완화를 크게 향상시켜 이전 접근 방식보다 성능이 뛰어납니다.
  • SelfCheckGPT:
    • 블랙박스 시나리오에서 흔히 볼 수 있는 출력 확률을 사용할 수 없는 경우 GPT를 사용하여 환각을 평가합니다.
    • BERTScore가 포함된 SelfCheckGPT 및 질문 응답이 포함된 SelfCheckGPT와 같은 변형을 활용하여 정보의 일관성을 평가합니다.
    • 다양한 SelfCheckGPT 변종의 조합은 보완적인 결과를 제공하여 환각 감지를 향상시킵니다.
  • GPT4 메시지:
    • 요약 작업에 중점을 두고 요약에서 환각을 감지하기 위한 다양한 자극 기술과 모델을 조사합니다.
    • 기술에는 다양한 LLM과 기본 접근 방식을 비교하는 일련의 사고 유도 및 문장별 유도가 포함됩니다.
    • 몇 번의 프롬프트와 프롬프트의 조합은 환각 감지 시 LLM의 성능을 향상시킵니다.
  • G-EVAL:
    • LLM이 일련의 사고와 양식 작성을 사용하여 자연어 생성(NLG)의 품질을 평가할 수 있는 프레임워크를 제공합니다.
    • 이전 접근 방식보다 훨씬 뛰어난 성능을 발휘하며 특히 요약 및 대화 생성 데이터세트에 효과적입니다.
    • 생성된 텍스트의 환각과 일관성을 평가하기 위해 프롬프트, 일련의 사고 및 채점 기능을 결합합니다.

    1. 전문가 모델 혼합이란 무엇입니까?
    • 답변:


    7. LLM을 평가할 때 복잡성을 지표로 지나치게 의존하는 것이 문제가 될 수 있는 이유는 무엇입니까?

    • 답변