Skip to article frontmatterSkip to article content
Site not loading correctly?

This may be due to an incorrect BASE_URL configuration. See the MyST Documentation for reference.

AI 에이전트 및 LLM 아키텍처

이 가이드가 존재하는 이유

현재 지능형 시스템을 구축한다는 것은 세 개 회사의 API 호출을 빌려쓰는 것을 의미한다. 그들이 제공하는 Stack 위에서 시스템을 구축하는 엔지니어들은 요청과 응답 사이에서 무슨 일이 일어나는지 설명하기 어렵다. 곧 이런 미래가 다가오게 된다.

디지털 독립이란 클라우드 모델 사용을 거부하는 것이 아니다. 언제든 떠날 수 있는 자유를 의미한다. KV 캐시 비용이 얼마인지, 검색 패턴이 미세 조정보다 나은 경우는 언제인지, 자체 하드웨어에서 오픈 소스 모델을 어떻게 제공하는지, 평가는 어떻게 해야 하는지 등 이를 아는 엔지니어는 스스로 사용할 스택을 정할 수 있게 된다. 반면, SDK만 사용하는 엔지니어는 LLM 프로바이더가 제공하는 기능 및 가격 정책을 따를 수 밖에 없다.

이 가이드는 가능한 많은 사람들이 다양한 환경에서 자유를 얻기 위한 마음으로 작성되었다.

어떤 내용이 있나?

여기서 다루는 내용은 다음과 같다.

항목내용
I. 모델의 구성 요소토큰화, 임베딩, 어텐션, 생성 루프, 디코딩 전략, 컨텍스트 윈도우 실패 모드, 환각 그리고 경제성(비용, 지연 시간, 결정성, 신뢰성, 클라우드 vs 자체 호스팅)
II. 모델과의 인터페이스프롬프트 엔지니어링, 컨텍스트 엔지니어링 및 패턴 카탈로그, 구조화된 출력 및 제약 조건부 디코딩
III. RAG검색 패턴 단계(단순 → 하이브리드 → 재순위화 → GraphRAG → 에이전트형 → 적응형), 벡터 인덱스 및 ANN 내부 구조, 청킹, RAG 평가
IV. 에이전트분산 시스템으로서의 에이전트, 패턴 카탈로그(체이닝, 라우팅, 병렬화, 오케스트레이터-워커, 평가자-최적화 도구), 도구 호출, 메모리 및 추론 전략, 다중 에이전트 시스템 및 오류 분류 체계
V. 통합모델 컨텍스트 프로토콜(MCP)의 엔드 투 엔드 구현, JVM에서 스택 구성
VI. 제품화평가 시스템 구축, 관찰 가능성 및 OpenTelemetry GenAI 규약, 보안 인젝션, 심층 방어, 비용 및 지연 시간 엔지니어링
VII. 커스텀 모델미세 조정(LoRA, QLoRA, DoRA, RLHF/DPO, 증류), 오픈 소스 모델 배포(PagedAttention, 연속 배치 처리, 양자화, 디코딩), 사전 학습 및 스케일링 법칙
VIII. 종합참조 아키텍처, 조직 도입 및 거버넌스, 아키텍처 결정 기록 및 예시