이 가이드가 존재하는 이유¶
현재 지능형 시스템을 구축한다는 것은 세 개 회사의 API 호출을 빌려쓰는 것을 의미한다. 그들이 제공하는 Stack 위에서 시스템을 구축하는 엔지니어들은 요청과 응답 사이에서 무슨 일이 일어나는지 설명하기 어렵다. 곧 이런 미래가 다가오게 된다.
디지털 독립이란 클라우드 모델 사용을 거부하는 것이 아니다. 언제든 떠날 수 있는 자유를 의미한다. KV 캐시 비용이 얼마인지, 검색 패턴이 미세 조정보다 나은 경우는 언제인지, 자체 하드웨어에서 오픈 소스 모델을 어떻게 제공하는지, 평가는 어떻게 해야 하는지 등 이를 아는 엔지니어는 스스로 사용할 스택을 정할 수 있게 된다. 반면, SDK만 사용하는 엔지니어는 LLM 프로바이더가 제공하는 기능 및 가격 정책을 따를 수 밖에 없다.
이 가이드는 가능한 많은 사람들이 다양한 환경에서 자유를 얻기 위한 마음으로 작성되었다.
어떤 내용이 있나?¶
여기서 다루는 내용은 다음과 같다.
| 항목 | 내용 |
|---|---|
| I. 모델의 구성 요소 | 토큰화, 임베딩, 어텐션, 생성 루프, 디코딩 전략, 컨텍스트 윈도우 실패 모드, 환각 그리고 경제성(비용, 지연 시간, 결정성, 신뢰성, 클라우드 vs 자체 호스팅) |
| II. 모델과의 인터페이스 | 프롬프트 엔지니어링, 컨텍스트 엔지니어링 및 패턴 카탈로그, 구조화된 출력 및 제약 조건부 디코딩 |
| III. RAG | 검색 패턴 단계(단순 → 하이브리드 → 재순위화 → GraphRAG → 에이전트형 → 적응형), 벡터 인덱스 및 ANN 내부 구조, 청킹, RAG 평가 |
| IV. 에이전트 | 분산 시스템으로서의 에이전트, 패턴 카탈로그(체이닝, 라우팅, 병렬화, 오케스트레이터-워커, 평가자-최적화 도구), 도구 호출, 메모리 및 추론 전략, 다중 에이전트 시스템 및 오류 분류 체계 |
| V. 통합 | 모델 컨텍스트 프로토콜(MCP)의 엔드 투 엔드 구현, JVM에서 스택 구성 |
| VI. 제품화 | 평가 시스템 구축, 관찰 가능성 및 OpenTelemetry GenAI 규약, 보안 인젝션, 심층 방어, 비용 및 지연 시간 엔지니어링 |
| VII. 커스텀 모델 | 미세 조정(LoRA, QLoRA, DoRA, RLHF/DPO, 증류), 오픈 소스 모델 배포(PagedAttention, 연속 배치 처리, 양자화, 디코딩), 사전 학습 및 스케일링 법칙 |
| VIII. 종합 | 참조 아키텍처, 조직 도입 및 거버넌스, 아키텍처 결정 기록 및 예시 |