일반적인 생성 AI 인터뷰 질문
소유자: Aishwarya Nr
생성 모델
- 생성 모델과 차별 모델의 차이점은 무엇인가요?
- 생성적 적대 신경망(Generative Adversarial Network)의 아키텍처와 생성자와 판별자가 훈련 중에 상호 작용하는 방식을 설명합니다.
- VAE(Variational Autoencoder)의 개념과 잠재 변수를 아키텍처에 통합하는 방법을 설명합니다.
- 조건부 생성 모델은 무조건 생성 모델과 어떻게 다릅니까?
답변:
- 텍스트-이미지 합성에서 텍스트 설명이 주어지면 조건부 생성 모델은 설명과 일치하는 해당 이미지를 생성할 수 있으므로 텍스트 프롬프트에서 이미지를 생성하는 것과 같은 애플리케이션이 가능해집니다.
조건부 생성 모델은 추가 정보나 조건을 통합하여 생성된 출력에 대한 더 큰 유연성과 제어를 제공하므로 특정 제약 조건이나 입력 조건에 따른 맞춤형 생성이 필요한 작업에 적합합니다.
- GAN의 맥락에서 모드 붕괴란 무엇이며 훈련 중에 이를 해결하기 위해 어떤 전략을 사용할 수 있습니까?
답변:
- 미니 배치 식별: 이 기술은 모드 붕괴에 불이익을 주어 생성기가 더 다양한 샘플을 생성하도록 장려합니다.
- 다양한 훈련 데이터: 훈련 데이터 세트에 목표 분포의 다양한 샘플이 포함되어 있는지 확인하면 모드 붕괴를 방지하는 데 도움이 될 수 있습니다.
- 정규화 기술: 가중치 정규화, 드롭아웃, 스펙트럼 정규화와 같은 기술을 사용하여 GAN 훈련을 정규화하여 모드 붕괴에 대한 저항력을 높일 수 있습니다.
- 동적 학습률: 훈련 중에 생성기와 판별자의 학습률을 동적으로 조정하면 훈련 프로세스를 안정화하고 모드 붕괴를 방지하는 데 도움이 될 수 있습니다.
- 앙상블 방법: 다양한 초기화 또는 아키텍처로 여러 GAN을 훈련하고 앙상블 방법을 사용하여 출력을 결합하면 모드 붕괴를 완화하는 데 도움이 될 수 있습니다.
- 생성 모델에서 과적합이 어떻게 나타나고, 훈련 중에 이를 방지하기 위해 어떤 기술을 사용할 수 있나요?
- 그래디언트 클리핑(Gradient Clipping)이란 무엇이며, 생성 모델의 훈련 프로세스를 안정화하는 데 어떻게 도움이 됩니까?
답변:
- 진동 완화: 훈련 중에 생성기와 판별기(GAN의 경우) 또는 인코더와 디코더(VAE의 경우) 사이의 복잡한 상호 작용으로 인해 경사가 광범위하게 진동할 수 있습니다.
- 수렴 강화: 경사도가 너무 크거나 너무 작아지는 것을 방지함으로써 경사도 클리핑은 모델 매개변수에 대한 보다 일관되고 예측 가능한 업데이트를 촉진합니다.
- 강건성 향상: 경사 클리핑은 학습률이나 배치 크기와 같은 초매개변수의 변화에 대해 학습 프로세스를 더욱 강력하게 만드는 데 도움이 될 수 있습니다.
- 사용 가능한 데이터세트가 제한적인 경우 생성 모델을 훈련하기 위한 전략을 논의합니다.
답변:
- 전이 학습: 더 큰 데이터 세트에 대해 훈련된 사전 훈련된 모델을 활용하면 생성 모델에 대한 귀중한 초기화를 제공할 수 있습니다.
- 반지도 학습: 제한된 데이터 세트 외에 소량의 라벨이 지정된 데이터를 사용할 수 있는 경우 준지도 학습 기술을 사용할 수 있습니다.
- 정규화: 가중치 감소, 드롭아웃, 배치 정규화와 같은 정규화 기술은 모델의 매개변수에 제약 조건을 적용하거나 학습 중에 확률성을 도입하여 과적합을 방지하는 데 도움이 될 수 있습니다.
- 점진적 성장을 사용하는 GAN(생성적 적대 신경망): PGGAN(점진적 성장 GAN)은 훈련 중에 생성된 이미지의 해상도를 낮은 해상도부터 시작하여 점차적으로 세부 사항을 추가하면서 점차적으로 증가시킵니다.
- 앙상블 방법: 다양한 아키텍처 또는 초기화로 여러 생성 모델을 훈련하고 앙상블 방법을 사용하여 출력을 결합하면 소규모 데이터세트의 한계를 완화하는 데 도움이 될 수 있습니다.
- 데이터 합성: 사용 가능한 데이터 세트가 극히 제한적인 경우 생성적 적대 네트워크(GAN) 또는 변형 자동 인코더(VAE)와 같은 데이터 합성 기술을 사용하여 합성 데이터 샘플을 생성할 수 있습니다.
- 생성 모델 훈련에 커리큘럼 학습이 어떻게 적용될 수 있는지 설명합니다.
답변:
- 향상된 모델 성능: 모델은 학습 프로세스를 구조화함으로써 단순한 작업에 대한 탄탄한 기반을 구축했기 때문에 복잡한 예에 대해 더 나은 일반화 및 성능을 달성할 수 있습니다.
- 안정화된 학습 프로세스: 학습 데이터의 복잡성을 점차적으로 증가시키면 학습 프로세스가 더욱 안정적으로 이루어질 수 있으며, 학습 초기에 모델이 열악한 로컬 최소값에 갇히는 위험을 줄일 수 있습니다.
- 과적합 감소: 복잡한 예제로 이동하기 전에 간단한 예에서 일반 패턴을 효과적으로 학습함으로써 모델이 학습 데이터에 과적합되는 경향이 줄어들 수 있습니다.
- 학습률 스케줄링의 개념과 시간이 지남에 따라 생성 모델의 훈련 프로세스를 최적화하는 역할을 설명합니다.
답변:
- 수렴 속도 향상: 처음에 더 높은 학습률을 사용하면 가중치에 대한 더 큰 업데이트를 허용하여 수렴을 가속화할 수 있습니다.
- 모델 성능 향상: 시간이 지남에 따라 학습률을 신중하게 조정하면 모델이 최적이 아닌 로컬 최소값이나 안장점을 더 효율적으로 벗어날 수 있어 잠재적으로 생성 작업에서 전반적인 성능이 향상될 수 있습니다.
- 훈련 역학에 대한 조정: 훈련 단계에 따라 학습 속도가 다를 수 있습니다.
일반적인 일정 전략:
- 단계 감쇠: 몇 세대마다 학습률을 한 배씩 줄입니다.
- 지수적 감쇠: 시간이 지남에 따라 학습률이 기하급수적으로 지속적으로 감소합니다.
- 코사인 어닐링: 코사인 함수에 따라 학습률을 조정하여 로컬 최소값을 탈출하는 데 도움이 될 수 있는 주기적 조정을 수행합니다.
- 준비 일정: 학습 초기 단계에서 학습률을 작은 값에서 큰 값으로 점차적으로 높이면 매우 심층적인 모델의 학습을 안정화하는 데 도움이 될 수 있습니다.
- 생성 모델의 맥락에서 L1 및 L2 손실 함수의 사용을 비교하고 대조합니다.
답변:
- L2 손실 선호: L2 손실은 더 부드러운 출력을 목표로 하고 가우스 잡음 가정이 합리적인 문제를 처리할 때 선호되는 선택이 될 수 있습니다.
- GAN의 맥락에서 손실 함수에서 그래디언트 페널티의 목적은 무엇입니까?
답변:
- 모드 축소 방지: 생성기가 제한된 다양한 출력을 생성할 때 모드 축소가 발생합니다.
- 강화된 견고성: 그래디언트 페널티의 정규화 효과는 초매개변수 설정 및 초기화에 대한 학습 프로세스를 더욱 강력하게 만들어 이러한 요소에 대한 GAN의 민감도를 줄이고 수렴을 더 쉽게 달성할 수 있게 해줍니다.
- 부드러운 결정 경계 장려: Lipschitz 연속성을 시행함으로써 경사 페널티는 판별자가 더 부드러운 결정 경계를 형성하도록 장려합니다.
가중 처벌의 예:
- Wasserstein GAN with Gradient Penalty(WGAN-GP): 손실 함수에 경사 페널티 항을 도입하여 Lipschitz 제약 조건을 적용하여 훈련 과정의 안정성과 품질을 크게 향상시키는 잘 알려진 변형입니다.
- 스펙트럼 정규화: 그 자체로는 경사 페널티는 아니지만 스펙트럼 정규화는 가중치를 정규화하여 판별기의 립시츠 상수를 제어하는 또 다른 기술입니다. 이는 경사에 간접적으로 영향을 미치고 훈련 안정성에 기여합니다.
대규모 언어 모델
- 자연어 처리의 맥락에서 전이 학습의 개념을 논의합니다.
- GPT(Generative Pre-trained Transformer)와 BERT(변압기의 양방향 인코더 표현)와 같은 모델 간의 주요 차이점을 강조하시겠습니까?
답변:

이미지 출처: https://heidloff.net/article/foundation-models-transformers-bert-and-gpt/
GPT(Generative Pre-trained Transformer) 및 BERT(BiDirectional Encoder Representations from Transformers)는 NLP(자연어 처리) 분야의 두 가지 기본 아키텍처로, 각각 고유한 접근 방식과 기능을 갖추고 있습니다.
아키텍처 및 교육 접근 방식:
- GPT:
- GPT is designed as an autoregressive model that predicts the next word in a sequence given the previous words. Its training is based on the left-to-right context only.
- 모델이 수신한 입력을 기반으로 텍스트를 생성하는 생성 작업에 주로 사용됩니다.
- GPT의 아키텍처는 Transformer 디코더 블록의 스택입니다.
- BERT:
- BERT는 MLM(Masked Language Model)과 NSP(Next Sentence Prediction)라는 두 가지 전략을 사용하여 사전 학습되었습니다.
- BERT의 아키텍처는 Transformer 인코더 블록의 스택입니다.
사용 사례 및 애플리케이션:
BERT:
교육 및 미세 조정:
BERT:
성능 및 효율성:
BERT:
- 변환기 모델은 RNN의 어떤 문제를 해결합니까?
답변:
- 장기 종속성: RNN은 특히 기본 형식에서 사라지고 폭발하는 그래디언트 문제로 인해 장기 종속성을 포착하는 데 어려움을 겪습니다.
- 확장성: RNN의 순차적 특성으로 인해 계산 복잡성과 메모리 요구 사항이 시퀀스 길이에 따라 선형적으로 증가하므로 긴 시퀀스를 처리할 때 확장성이 떨어집니다.
- 변압기 모델에 상대 위치 정보를 통합하는 것이 중요한 이유는 무엇입니까?
- 바닐라 트랜스포머 모델의 고정되고 제한된 주의 범위로 인해 어떤 문제가 발생합니까?
- 순진하게 컨텍스트 길이를 늘리는 것이 변환기 모델에서 더 긴 컨텍스트를 처리하기 위한 간단한 솔루션이 아닌 이유는 무엇입니까?
- 셀프 어텐션은 어떻게 작동하나요?
답변:
Self-attention은 모델이 입력 데이터의 서로 다른 부분의 중요성을 서로 비교하여 가중치를 부여할 수 있는 메커니즘입니다.
쿼리, 키 및 값 벡터: 각 입력 요소에 대해 모델은 학습 가능한 가중치를 지정하는 쿼리 벡터, 키 벡터 및 값 벡터라는 세 가지 벡터를 생성합니다.
주의 점수: 모델은 한 요소의 쿼리 벡터와 다른 모든 요소의 키 벡터 간의 내적을 수행한 후 소프트맥스 연산을 수행하여 점수를 정규화하여 주의 점수를 계산합니다.
가중 합계 및 출력: 관심 점수는 각 요소의 출력을 형성하는 값 벡터의 가중 합계를 생성하는 데 사용됩니다.

- LLM에 사용되는 사전 훈련 메커니즘은 무엇이며 몇 가지를 설명하십시오.
- 다중 헤드 주의가 필요한 이유는 무엇입니까?
- RLHF란 무엇이며 어떻게 사용되나요?
답변:

이미지 출처: https://huggingface.co/blog/rlhf
RLHF(Reinforcement Learning from Human Feedback)는 출력을 인간의 선호도, 가치 및 윤리에 맞추는 방식으로 언어 모델을 미세 조정하는 데 사용되는 방법입니다.
사전 학습: 모델은 처음에 언어에 대한 폭넓은 이해를 학습하기 위해 대량의 텍스트 데이터에 대해 사전 학습되었습니다.
사람의 피드백 수집: 사람이 특정 시나리오에서 모델의 결과를 검토하고 피드백이나 수정 사항을 제공합니다.
강화 학습: 인간의 피드백이 보상 신호 역할을 하여 모델이 인간의 판단에 더 부합하는 출력을 생성하도록 장려하는 강화 학습 기술을 사용하여 모델을 미세 조정합니다.
RLHF는 안전하고 편견 없는 콘텐츠 생성, 대화 에이전트의 품질 향상, AI 생성 조언이 윤리적으로 건전한지 확인하는 등 인간 가치에 대한 높은 수준의 조정이 필요한 작업에 특히 유용합니다.
Huggingface 기사 양식 읽기: https://huggingface.co/blog/rlhf
- LLM의 맥락에서 치명적인 망각이란 무엇입니까?
- 변환기 기반 시퀀스-시퀀스 모델에서 인코더와 디코더의 주요 기능은 무엇입니까?
- 변환기 모델에서 위치 인코딩이 중요한 이유는 무엇이며 self-attention 작업의 맥락에서 어떤 문제를 해결합니까?
- 특정 NLP 작업을 위해 사전 훈련된 변환기를 미세 조정하기 위해 전이 학습을 적용할 때, 특히 도메인별 데이터를 처리할 때 효과적인 지식 전달을 보장하기 위해 어떤 전략을 사용할 수 있습니까?
- 변환기 기반 인코더-디코더 모델에서 교차 주의의 역할을 논의합니다.
- ****언어 모델 학습에서 희소(예: 교차 엔트로피) 및 밀집(예: 평균 제곱 오류) 손실 함수 사용의 영향을 비교하고 대조합니다.
- 강화 학습을 대규모 언어 모델의 훈련에 어떻게 통합할 수 있으며, RL 기반 접근 방식에 적합한 손실 함수를 선택하는 데 어떤 어려움이 발생할 수 있습니까?
다중 모드 모델(비생성 모델 포함)
1. 다중 모달 언어 모델에서 이미지 캡션이나 시각적 질문 답변과 같은 작업을 수행하기 위해 시각적 및 텍스트 양식의 정보가 어떻게 효과적으로 통합됩니까?
2. VisualBERT 또는 CLIP과 같은 모델에서 교차 모드 주의 메커니즘의 역할을 설명합니다.
답변:
교차 모달 주의 메커니즘은 VisualBERT 및 CLIP과 같은 모델에서 중추적인 역할을 하며 이러한 시스템이 텍스트 단서에 응답하여 시각적 데이터의 관련 부분에 동적으로 집중할 수 있도록 하며 그 반대의 경우도 마찬가지입니다.

VisualBERT: 변환기 아키텍처 내에서 교차 모드 주의를 사용하여 텍스트의 맥락을 기반으로 이미지의 특정 영역에 주의를 기울입니다.

CLIP: VisualBERT와 같은 방식으로 교차 모달 어텐션을 사용하지는 않지만 CLIP은 이미지-텍스트 쌍의 방대한 데이터 세트를 학습하여 이미지와 텍스트를 효과적으로 연관시키는 방법을 학습합니다.
두 경우 모두 모델 간 주의 또는 학습 메커니즘을 통해 모델은 시각적 요소와 텍스트 설명 간의 복잡한 관계를 이해하고 활용할 수 있으므로 두 양식에 대한 미묘한 이해가 필요한 작업의 성능이 향상됩니다.
3. 이미지-텍스트 일치와 같은 작업의 경우 시각적 정보와 텍스트 정보의 정렬된 쌍을 생성하기 위해 일반적으로 훈련 데이터에 주석이 어떻게 추가되며 어떤 고려 사항을 고려해야 합니까?
4. 이미지 합성을 위한 생성 모델을 학습시킬 때 생성된 이미지와 대상 이미지 간의 차이를 평가하는 데 사용되는 일반적인 손실 함수는 무엇이며 학습 과정에 어떻게 기여합니까?
5. 지각 손실이란 무엇이며 생성된 이미지와 대상 이미지 간의 지각 유사성을 측정하기 위해 이미지 생성 작업에서 어떻게 활용됩니까?
- 마스크된 언어-이미지 모델링이란 무엇입니까?
- Cross-attention 메커니즘에서 얻은 Attention 가중치는 다중 모드 모델의 생성 프로세스에 어떤 영향을 줍니까?
- 단일 모드 생성 모델과 비교하여 다중 모드 생성 모델을 훈련할 때 고유한 과제는 무엇입니까?
- 다중 모드 생성 모델은 훈련 시 데이터 희소성 문제를 어떻게 해결합니까?
- VLP(Vision-Language Pre-training)의 개념과 강력한 비전 언어 모델 개발에 있어서 그 중요성을 설명합니다.
- CLIP 및 DALL-E와 같은 모델은 비전과 언어 양식의 통합을 어떻게 보여줍니까?
- 주의 메커니즘은 시각 언어 모델의 성능을 어떻게 향상합니까?
임베딩
1. 기계 학습에서 임베딩의 기본 개념은 무엇이며 원시 입력 데이터에 비해 정보를 어떻게 더 간결한 형태로 표현합니까?
- 단어 임베딩과 문장 임베딩을 비교하고 대조합니다.
답변:
- 애플리케이션: 동의어 감지, 품사 태그 지정, 명명된 엔터티 인식과 같은 단어 수준 작업에 적합합니다.
- 특성: 각 단어에 하나의 삽입이 있는 정적 표현을 제공하므로 여러 의미를 가진 단어에 대한 효율성이 잠재적으로 제한됩니다.
문장 삽입:
- 범위: 전체 의미론적 콘텐츠를 캡슐화하는 것을 목표로 임베딩 개념을 전체 문장이나 긴 텍스트로 확장합니다.
- 애플리케이션: 문서 분류, 의미적 텍스트 유사성, 감정 분석 등 더 넓은 맥락의 이해가 필요한 작업에 사용됩니다.
- 특성: 단어 상호 작용과 문장 구조를 고려하는 동적 표현을 제공하여 언어 사용의 맥락과 뉘앙스를 더 잘 포착합니다.
둘 중 선택 시 고려 사항:
- 작업 요구사항: 단어 임베딩은 단어 수준에서 언어적 특성을 분석하는 데 선호되는 반면, 문장 임베딩은 문장 또는 더 큰 텍스트 단위 이해와 관련된 작업에 더 좋습니다.
- 문맥 민감도: 문장 임베딩 또는 문맥 단어 임베딩(예: BERT)은 다양한 문맥에 걸쳐 단어의 다양한 의미를 처리하는 데 더 능숙합니다.
- 계산 리소스: 특히 BERT와 같은 모델에서 문장 임베딩을 생성하고 처리하는 것은 리소스 집약적일 수 있습니다.
- 데이터 가용성: 임베딩의 효율성은 학습 데이터의 다양성 및 크기와 관련이 있습니다.
단어 임베딩과 문장 임베딩 사이의 결정은 NLP 작업의 특정 요구 사항, 컨텍스트의 중요성, 계산 고려 사항 및 훈련 데이터의 특성에 따라 달라집니다.
- 상황별 임베딩의 개념을 설명하세요.
- 텍스트, 이미지 등 다양한 양식의 정보가 공유 임베딩 공간에 표시되는 교차 모달 임베딩 생성과 관련된 과제와 전략에 대해 논의합니다.
5. 단어 임베딩을 훈련할 때 훈련 데이터에서 발생 빈도가 제한된 희귀 단어에 대한 표현을 효과적으로 캡처하도록 모델을 어떻게 설계할 수 있습니까?
- 과적합을 방지하고 모델의 일반화 능력을 향상시키기 위해 임베딩 훈련 중에 사용되는 일반적인 정규화 기술에 대해 논의합니다.
7. 사전 훈련된 임베딩을 다운스트림 작업의 전이 학습에 어떻게 활용할 수 있으며, 임베딩 생성 측면에서 전이 학습이 제공하는 이점은 무엇입니까?
답변:
- 특성 추출: 여기에서는 사전 학습된 임베딩이 다운스트림 작업을 위한 고정 특성으로 사용됩니다.
사전 훈련된 임베딩은 캡슐화된 일반적인 언어 또는 의미 지식을 활용하여 다운스트림 작업에서 직접 사용하거나 미세 조정할 수 있습니다.
효율성: 다운스트림 작업에서 높은 성능을 달성하는 데 필요한 데이터 및 계산 리소스의 양을 크게 줄입니다.
일반화: 크고 다양한 데이터 세트에 대해 훈련된 임베딩은 언어 또는 시각적 개념에 대한 광범위한 이해를 제공하여 모델의 일반화 능력을 향상시킵니다.
빠른 적응: 미세 조정을 통해 모델이 특정 작업에 빠르게 적응하고 개발 주기를 가속화하며 보다 유연한 애플리케이션을 활성화할 수 있습니다.
- 임베딩 맥락에서 양자화란 무엇이며 표현 품질을 유지하면서 모델의 메모리 공간을 줄이는 데 어떻게 기여합니까?
- 표 형식 데이터에서 카디널리티가 높은 범주형 특성을 처리할 때 의미 있는 표현을 캡처하기 위해 신경망을 사용하여 임베딩을 효율적으로 구현하고 훈련하는 방법은 무엇입니까?
- 대규모 임베딩을 처리할 때 대규모 데이터베이스에서 유사한 임베딩을 빠르게 검색할 수 있는 최근접 이웃 검색을 위한 효율적인 방법을 제안하고 구현합니다.
- LLM이 임베딩 생성 중에 어휘에서 벗어난 단어를 발견하는 시나리오에서는 그러한 사례를 처리하기 위한 전략을 제안하십시오.
- LLM에서 생성된 임베딩 품질을 정량적으로 평가하기 위한 측정항목을 제안합니다.
- 임베딩 학습의 맥락에서 삼중 손실의 개념을 설명합니다.
14.
훈련, 추론 및 평가
- 훈련 중 LLM의 과적합과 관련된 문제에 대해 논의합니다.
2. 대규모 언어 모델에는 학습률을 신중하게 조정해야 하는 경우가 많습니다.
- LLM을 사용하여 시퀀스를 생성할 때 긴 컨텍스트 길이를 어떻게 효율적으로 처리할 수 있습니까?
답변:
- Flash Attention: FlashAttention은 계산을 더 작은 블록으로 나누고 메모리 전송 오버헤드를 줄이고 처리 속도를 향상시켜 GPU의 주의 메커니즘을 최적화합니다.
- MQA(Multi-Query Attention): MQA는 표준 Multi-Head Attention(MHA)에 대한 최적화로, 헤드 전체에 '키'와 '값'을 투영하기 위한 공통 가중치 매트릭스를 공유하여 메모리 효율성과 더 빠른 추론 속도를 제공합니다.
- 위치 보간(PI): 수학적 보간 기술을 사용하여 기존 컨텍스트 크기에 맞게 위치 인덱스를 조정합니다.
- RoPE(로터리 위치 인코딩): 위치를 기준으로 기존 임베딩을 회전하여 보다 유연한 방식으로 시퀀스 위치를 캡처합니다.
- ALiBi(Attention with Linear Biases): 어텐션 메커니즘에 편향을 도입하고 확장된 컨텍스트에서 성능을 최적화하여 다양한 시퀀스 길이에 대한 Transformer의 적응성을 향상합니다.
- 희소 주의: 주의 점수를 계산할 때 콘텐츠 크기 내의 일부 토큰만 고려하여 입력 토큰 크기에 대해 선형 계산을 수행합니다.
4.
답변:
- 사람 평가: 관련성, 유창성, 일관성, 전반적인 품질과 같은 기준을 바탕으로 모델 출력의 품질을 평가하기 위해 사람 평가자를 모집합니다.
- BLEU(Bilingual Evaluation Understudy): 기계 번역 작업에 주로 사용되는 측정항목입니다.
- ROUGE(Recall-Oriented Understudy for Gisting Evaluation): 요약의 품질을 평가하는 데 사용됩니다.
- 다양성: 생성된 응답의 다양성과 고유성을 측정하며 종종 N-그램 다양성 또는 의미 유사성과 같은 측정항목을 사용하여 분석됩니다.
- 진실성 평가: LLM의 진실성을 평가하려면 LLM에서 생성된 답변을 사람의 답변과 비교하고, TruthfulQA와 같은 데이터 세트에 대한 벤치마킹, LLM 숨겨진 레이어 활성화에 대한 참/거짓 분류기 학습과 같은 기술이 필요합니다.
- LLM의 환각은 알려진 문제입니다. 이를 어떻게 평가하고 완화할 수 있습니까?
답변:
- 길이 정규화 시퀀스 로그 확률을 활용하여 모델 출력의 신뢰도를 평가합니다.
- 참조 기반 방법과 비교하여 번역 품질을 평가하고 환각을 감지하는 데 효과적입니다.
- 번역 과정에서 단순성과 계산 용이성을 제공합니다.
문장 유사성:
생성된 번역에 대한 소스 기여도의 백분율을 평가하고 낮은 소스 기여도를 감지하여 환각을 식별합니다.
문장 간의 의미 유사성 측정과 함께 참조 기반, 내부 측정 및 참조 없는 기술을 활용합니다.
LASER, LaBSE 및 XNLI와 같은 기술은 환각 감지 및 완화를 크게 향상시켜 이전 접근 방식보다 성능이 뛰어납니다.
SelfCheckGPT:
블랙박스 시나리오에서 흔히 볼 수 있는 출력 확률을 사용할 수 없는 경우 GPT를 사용하여 환각을 평가합니다.
BERTScore가 포함된 SelfCheckGPT 및 질문 응답이 포함된 SelfCheckGPT와 같은 변형을 활용하여 정보의 일관성을 평가합니다.
다양한 SelfCheckGPT 변종의 조합은 보완적인 결과를 제공하여 환각 감지를 향상시킵니다.
GPT4 메시지:
요약 작업에 중점을 두고 요약에서 환각을 감지하기 위한 다양한 자극 기술과 모델을 조사합니다.
기술에는 다양한 LLM과 기본 접근 방식을 비교하는 일련의 사고 유도 및 문장별 유도가 포함됩니다.
몇 번의 프롬프트와 프롬프트의 조합은 환각 감지 시 LLM의 성능을 향상시킵니다.
G-EVAL:
LLM이 일련의 사고와 양식 작성을 사용하여 자연어 생성(NLG)의 품질을 평가할 수 있는 프레임워크를 제공합니다.
이전 접근 방식보다 훨씬 뛰어난 성능을 발휘하며 특히 요약 및 대화 생성 데이터세트에 효과적입니다.
생성된 텍스트의 환각과 일관성을 평가하기 위해 프롬프트, 일련의 사고 및 채점 기능을 결합합니다.
- 전문가 모델 혼합이란 무엇입니까?
7. LLM을 평가할 때 복잡성을 지표로 지나치게 의존하는 것이 문제가 될 수 있는 이유는 무엇입니까?