LLM 에이전트 101

llm_guide.png

LLM 에이전트 소개

Large Language Model 에이전트의 약자인 LLM 에이전트는 고급 언어 처리와 계획 및 기억과 같은 다른 중요한 구성 요소를 혼합하기 때문에 꽤 인기를 얻고 있습니다.

사람들이 휴가 계획을 세우는 데 도움을 주는 가상 비서를 만들려고 한다고 상상해 보세요.

기본적인 가상 비서는 사전 프로그래밍된 응답을 사용하거나 인터넷 검색을 통해 이러한 질문에 답할 수 있습니다.

이는 계획, 예산 책정, 다양한 목적지에 대한 정보 찾기 등을 포함하기 때문에 어려운 질문입니다.

이러한 종류의 가상 비서를 구축하려면 질문을 이해하고 응답하기 위한 주요 "두뇌"인 LLM이 필요합니다.

Screenshot 2024-04-07 at 2.39.12 PM.png

이미지 출처: https://arxiv.org/pdf/2309.07864.pdf

위 이미지는 ??strong>대형 언어 기반 에이전트의 힘과 잠재력: 영감 조사??/p> 논문에서 제안된 LLM 기반 에이전트의 잠재적인 이론적 구조를 나타냅니다.

위의 프레임워크는 LLM 에이전트의 설계를 고유하고 독립적인 구성 요소로 나누는 한 가지 접근 방식을 나타냅니다.

본질적으로 LLM 에이전트는 LLM의 기본적인 질문 답변 기능 이상을 수행합니다.

LLM 에이전트 프레임워크

이전 섹션에서는 에이전트를 두뇌, 인식, 행동이라는 세 가지 주요 구성 요소로 나누는 LLM 에이전트를 이해하기 위한 하나의 프레임워크에 대해 논의했습니다.

이 프레임워크는 다음과 같은 필수 요소로 구성됩니다.

Screenshot 2024-04-07 at 2.53.23 PM.png

이미지 출처: https://developer.nvidia.com/blog/introduction-to-llm-agents/

  1. 에이전트 코어: 에이전트 코어는 AI 에이전트 내에서 중앙 의사 결정 구성 요소로 기능합니다.

  2. 메모리 모듈: 메모리 모듈은 AI 에이전트의 필수 구성 요소로, 내부 로그인 및 사용자 쿠션을 저장하기 위해 사용할 수 있습니다.

  3. 장기 기억: 몇 주 또는 몇 달과 같은 장기간에 걸친 대화의 기록을 유지합니다.

메모리 검색에는 의미론적 유사성을 기반으로 하는 기술을 사용하고 중요도, 최근성, 애플리케이션별 측정항목과 같은 요소로 보완됩니다.

  • 도구: 도구는 에이전트가 작업을 실행하기 위해 사용하는 사전 정의된 실행 워크플로를 실행합니다.

  • 계획 모듈: 변형된 문제를 해결하기 위해 적절한 접근 방법이 필요한 경우에 적용합니다.

  • 다중 에이전트 시스템(MAS)

    LLM 기반 에이전트는 인상적인 텍스트 이해 및 생성 기능을 보여주지만 일반적으로 다른 에이전트와 협력하고 사회적 상호 작용을 통해 배우는 능력이 부족하여 독립적으로 작동합니다.

    LLM 기반 다중 에이전트 시스템(MAS)은 다양한 에이전트 프로필, 에이전트 간 상호 작용 및 집단적 의사 결정에 우선 순위를 둡니다.

    LLM 기반 다중 에이전트 시스템은 주로 노동 분업의 원칙을 기반으로 여러 가지 이점을 제공합니다.

    다중 에이전트 상호작용 유형

    LLM 기반 시스템의 다중 에이전트 상호 작용은 크게 협력적 상호 작용과 적대적 상호 작용으로 분류될 수 있습니다.

    Screenshot 2024-04-07 at 3.03.48 PM.png

    이미지 출처: https://arxiv.org/pdf/2309.07864.pdf

    협력 상호작용:

    협력적 다중 에이전트 시스템에서 에이전트는 서로의 요구 사항과 능력을 평가하고 적극적으로 협업 작업과 정보 공유를 모색합니다.

    1. 무질서한 협력: 시스템 내의 여러 에이전트가 특정 순서나 공동 작업 흐름을 따르지 않고 자신의 관점과 의견을 자유롭게 표현합니다.
    2. 질서 있는 협력: 상담사는 의견을 표명하거나 토론에 참여할 때 특정 규칙이나 순서를 준수합니다.

    따라서 무질서한 협력은 개방적인 표현과 유연성을 허용하지만 조직이 부족하고 의사 결정에 어려움을 초래할 수 있습니다.

    적대적 상호작용

    협력 방법이 광범위하게 연구되는 동안, 연구자들은 게임 이론의 개념을 다중 에이전트 시스템에 도입하는 것의 이점을 점점 더 인식하고 있습니다.

    다중 에이전트 시스템의 유망한 발전에도 불구하고 장기간 토론 처리의 한계, 다중 에이전트 환경에서 계산 오버헤드 증가, 잘못된 합의로 수렴될 위험 등 몇 가지 과제가 여전히 남아 있습니다.

    MAS는 복잡한 환경에서 협업, 의사 결정 및 문제 해결을 향상시킬 수 있는 상당한 잠재력을 지닌 역동적인 연구 분야입니다.

    실제 LLM 에이전트: BabyAGI

    BabyAGI는 다양한 도메인에 걸쳐 다양한 작업을 수행하도록 설계된 인기 있는 작업 중심 자율 에이전트입니다.

    1. GPT-4(에이전트 코어):

    2. 솔방울(메모리 모듈):

    3. LangChain 프레임워크( 툴링 모듈):

    4. 작업관리(계획모듈):

    5. babyAGI

      이미지 출처: https://yoheinakajima.com/task-driven-autonomous-agent-utilizing-gpt-4-pinecone-and-langchain-for-diverse-applications/

    BabyAGI는 다음 단계를 통해 운영됩니다.

    1. 작업 완료: 시스템은 GPT-4 및 LangChain 기능을 사용하여 작업 목록의 작업을 처리하여 결과를 생성한 다음 Pinecone에 저장합니다.
    2. 새 작업 생성: BabyAGI는 완료된 작업 결과를 기반으로 GPT-4를 사용하여 새 작업을 생성하여 기존 작업과 겹치지 않는 작업을 보장합니다.
    3. 작업 우선순위 지정: 작업 우선순위 지정은 우선순위 지정 프로세스를 용이하게 하기 위해 GPT-4의 지원을 받아 새로운 작업 생성 및 우선순위를 기반으로 수행됩니다.

    여기에서 BabyAGI를 테스트하고 사용해 볼 수 있는 코드를 찾을 수 있습니다.

    기타 인기 있는 LLM 기반 에이전트는 여기에 나열되어 있습니다.

    LLM 에이전트 평가

    다양한 영역에서 뛰어난 성능을 발휘함에도 불구하고 LLM 기반 에이전트를 정량화하고 객관적으로 평가하는 것은 여전히 ​​어려운 일입니다.

    1. AgentBench
    2. 이글루
    3. 클렘벤치
    4. 공구벤치
    5. 젠트벤치

    Screenshot 2024-04-07 at 3.28.33 PM.png

    이미지: GentBench 프레임워크에서 지원되는 작업 및 데이터 세트

    작업별 지표 외에도 상담원을 평가할 수 있는 일부 차원은 다음과 같습니다.

    나만의 에이전트 구축(리소스)

    이제 LLM 에이전트와 그 기능을 이해했으므로 다음은 자신만의 LLM 에이전트를 구성하는 데 도움이 되는 몇 가지 주요 리소스입니다.

    1. 처음부터 나만의 LLM 에이전트를 만드는 방법: 가이드 안내
    2. 첫 번째 LLM 병력 구축
    3. LangChain에서 에이전트 구축
    4. 메모리를 보유하고 있는 LangChain의 의료 서비스 구축
    5. LangChain 에이전트 - 의사결정을 통해 도구 및 체인

    참고자료:

    1. 대응 언어 기반 에이전트의 잠재력: 영감 조사
    2. 대응 모델 기반 다중 에이전트: 진행 상황 및 주제에 대한 조사
    3. 프롬프트 엔지니어링 가이드의 LLM 에이전트
    4. LLM 에이전트 소개, Nvidia 블로그