LLM은 어떻게 작동하나? 3단계 원리
토큰·벡터·예측 3단계로 보는 LLM 작동 방식과 기업 도입 판단 기준

토큰·벡터·예측 3단계로 보는 LLM 작동 방식과 기업 도입 판단 기준

"ChatGPT는 왜 우리 회사 규정을 모를까?", "그럴듯한데 틀린 답은 왜 나올까?", "이걸 실무에 그대로 붙여도 되나?" 이런 질문이 회의 테이블에 오르면 대화는 대개 도구 비교로 흘러갑니다. 정작 판단에 필요한 것은 도구 목록보다 LLM이 답을 만드는 방식입니다. 작동 원리를 알면 어떤 업무에 붙일 수 있고 어디서부터 위험한지 갈립니다.
이 글에서는 LLM이 답변을 생성하는 3단계, 기업이 실제로 쓰는 세 갈래 용도, 도입 전에 확인할 세 가지 한계, 그리고 지금이 검토 시점인지 판단하는 체크리스트까지 정리했습니다. 5분이면 다음 회의에서 "우리는 어디부터 붙일지"를 말할 수 있는 수준까지 갑니다.
LLM은 Large Language Model, 대규모 언어 모델의 약자입니다. 방대한 텍스트에서 언어의 패턴을 학습해 주어진 문맥 다음에 올 표현을 예측하는 모델입니다. 요약, 초안 작성, 분류, 번역, 추론 흉내가 모두 이 한 가지 능력에서 나옵니다. 개념과 용어를 처음부터 훑고 싶다면 LLM이란? 5분 정리를 먼저 읽어도 좋습니다.
LLM은 지식을 조회하는 장치가 아닙니다. 질문을 받으면 학습한 언어 패턴을 바탕으로 가장 그럴듯한 문장을 그 자리에서 만들어냅니다. 어딘가에 있는 정답 문서를 꺼내오지 않습니다. 이 차이에서 뒤에 나올 활용처와 한계가 모두 갈립니다.
구분 | 일반 챗봇 | LLM |
|---|---|---|
작동 방식 | 사전에 정의한 규칙과 시나리오 | 문맥 기반 확률 예측 |
답변 범위 | 등록된 질문 안에서만 | 학습하지 않은 질문에도 응답 |
잘하는 일 | 반복 문의를 정확히 되풀이 | 요약, 초안 작성, 분류, 재구성 |
못하는 일 | 시나리오 밖 질문 | 근거 확인, 최신 사내 정보 |
주요 리스크 | 경직성과 이탈률 | 환각, 데이터 유출, 사용량 비용 |
운영 부담 | 시나리오를 사람이 계속 추가 | 근거 연결과 검증 절차 설계 |
일반 챗봇은 등록하지 않은 질문 앞에서 멈춥니다. LLM은 멈추지 않습니다. 이 점이 강점이면서 가장 큰 리스크입니다.
LLM이 학습한 것은 사실 자체가 아니라 언어가 이어지는 방식입니다. 그래서 문장은 자연스럽지만 그 안의 사실은 보증되지 않습니다. 학습 데이터는 특정 시점에서 끊깁니다. 우리 회사 규정집이나 지난달 계약서는 애초에 들어간 적이 없습니다. ChatGPT가 사내 문서를 모르는 이유도 여기에 있습니다.
내부 구조는 복잡하지만 도입을 판단하는 자리에서는 세 단계면 충분합니다.
LLM은 문장을 그대로 읽지 않고 토큰이라는 단위로 쪼갭니다. 토큰은 단어보다 작을 때가 많아서 "AI 전환 전략을 알려줘"라는 짧은 문장도 여러 조각으로 분해됩니다. 한국어는 영어보다 같은 의미를 담는 데 토큰이 더 많이 듭니다. 대부분의 모델이 토큰 단위로 과금하니 이 단계가 곧 비용 구조로 이어집니다. 과금 방식은 AI 토큰이란? 비용이 되는 이유에서 자세히 다뤘습니다.
각 토큰은 의미를 나타내는 숫자 좌표, 곧 벡터로 바뀝니다. "매출 보고서", "영업 실적", "분기 분석"처럼 쓰임이 가까운 표현은 좌표상에서도 가까이 놓입니다. 덕분에 LLM은 키워드가 정확히 일치하지 않아도 비슷한 의미를 알아봅니다. 사내 문서 검색에서 단어가 조금 달라도 원하는 문단을 찾아내는 힘이 여기서 나옵니다.
마지막 단계에서 모델은 지금까지의 문맥을 보고 다음에 올 가능성이 가장 높은 토큰을 하나 고릅니다. 고른 결과를 다시 문맥에 넣어 그다음 토큰을 고릅니다. 답변 한 문단은 이 선택을 수백 번 반복한 결과입니다.
여기에 환각의 뿌리가 있습니다. 모델에는 "모르니까 비워두자"라는 선택지가 기본으로 들어 있지 않습니다. 근거가 없어도 확률이 가장 높은 문장을 계속 이어 붙이기 때문에 틀린 내용이 확신에 찬 문장으로 나옵니다.
Menlo Ventures가 2025년 11월 미국 기업 AI 의사결정자 495명을 조사했습니다. 그해 기업의 생성형 AI 지출은 370억 달러로 2023년 17억 달러에서 크게 뛰었고, 절반 이상이 인프라가 아니라 실제 업무에 쓰는 애플리케이션 영역으로 갔습니다. 돈이 실험을 떠나 업무로 옮겨 갔습니다. 그 돈은 대체로 세 갈래로 몰립니다.
규정, 제안서, 회의록, 보고서가 부서별 드라이브에 흩어져 있으면 아는 사람에게 묻는 것이 가장 빠른 검색 방법이 됩니다. LLM은 이 지점을 자연어 질문 하나로 대체합니다. 다만 LLM 혼자서는 사내 문서를 볼 수 없으니 문서를 찾아 근거로 넣어주는 RAG 구조가 함께 필요합니다.
실무자가 가장 오래 붙잡는 순간은 빈 화면 앞입니다. 영업 미팅 녹취를 넣으면 회의록 초안, 후속 이메일, CRM 입력용 요약이 한 번에 나옵니다. 사람은 쓰는 대신 고치는 일만 하면 되므로 문서 한 건당 걸리던 시간이 눈에 띄게 줄어듭니다.
고객센터는 반복 문의의 1차 응대를 넘기고, 인사·재무·IT 부서는 "휴가 규정이 어떻게 되나요" 같은 내부 문의 대응 시간을 줄입니다. 여기서 성패는 모델 성능보다 업무 흐름에 어떻게 끼워 넣느냐에서 갈립니다. 어떤 부서의 어떤 병목을 먼저 걷어낼지 진단하는 일이 도구 선택보다 앞에 옵니다.
Stanford RegLab이 2024년 발표한 연구에서 일반 LLM에 연방 판례에 관한 구체적 질문을 던졌을 때 환각률은 모델에 따라 58~88%로 나타났습니다. 같은 팀이 상용 법률 AI 도구를 검증한 후속 연구에서는 근거 문서를 연결한 제품도 17~33%의 오류율을 보였습니다. 근거를 붙이면 크게 줄지만 0은 되지 않습니다. 법무, 재무, 인사처럼 정확성이 곧 리스크인 업무에서는 출처 표시, 사람 승인 단계, 로그 보관을 함께 설계해야 합니다. 원인별 대응은 AI 환각 원인 3가지와 줄이는 법에 정리돼 있습니다.
Netskope Threat Labs는 2025년 데이터 기준으로 기업 내 생성형 AI 관련 데이터 정책 위반이 전년 대비 두 배 이상 늘었다고 보고했습니다. 유출 시도의 상당수가 규제 대상 데이터, 지식재산, 소스 코드, 자격 증명이었습니다. IBM의 2025년 조사에서 통제되지 않은 AI 사용이 얽힌 침해 사고는 평균 463만 달러가 들었습니다. 일반 침해보다 약 67만 달러 높습니다. 계정을 열어주기 전에 어떤 데이터가 어디로 가고 얼마나 보관되는지, 권한과 비식별 기준은 무엇인지 먼저 정해야 합니다.
LLM 비용은 계정당 구독료로 끝나지 않습니다. 토큰 사용량에 따른 API 요금, 문서를 쓸 수 있는 상태로 정리하는 작업, 기존 시스템 연동, 품질 모니터링, 사용자 교육이 함께 붙습니다. 총액은 업무 범위와 사용량에 따라 크게 달라집니다. 한 부서 한 업무로 범위를 좁혀 실측한 다음 확산 여부를 판단하는 편이 안전합니다.
다음 중 3개 이상 해당하면 검토를 시작할 시점입니다. 2개 이하라면 도구보다 업무 진단이 먼저입니다.
반복 업무가 한 부서에 몰려 있습니다
반복 문의나 반복 문서 작업이 특정 부서에 몰려 있고 담당자가 누구인지 이미 알고 있습니다.
문서 찾는 시간이 작업 시간보다 깁니다
필요한 문서가 어디 있는지 찾는 데 걸리는 시간이 실제 작업 시간보다 길 때가 있습니다.
직원들이 이미 개인 계정으로 쓰고 있습니다
생성형 AI를 개인 계정으로 쓰고 있는데 무엇을 입력하는지 회사가 파악하지 못합니다.
합격 기준을 문장으로 쓸 수 있습니다
자동화하려는 업무의 결과물이 어떤 상태여야 합격인지 문장으로 설명할 수 있습니다.
데이터 반출 기준을 정할 사람이 있습니다
권한과 반출 기준을 결정할 의사결정자가 이미 정해져 있습니다.
3개월 안에 숫자로 볼 업무가 있습니다
성과를 숫자로 확인할 대상 업무를 하나 지목할 수 있습니다.
LLM의 작동 방식을 알고 나면 다음 질문은 하나로 좁혀집니다. "우리 문서와 업무에 어떻게 붙일 것인가"입니다. 답의 출발점은 RAG입니다. LLM이 문장을 만드는 엔진이라면, RAG는 답하기 전에 사내 문서에서 근거를 찾아 모델 앞에 놓아주는 구조입니다. 앞서 본 환각률이 근거 연결만으로 크게 떨어졌던 것도 같은 원리입니다.
우리 회사에 LLM이 먼저인지, RAG가 먼저인지, 아니면 업무 정리가 먼저인지 헷갈린다면 순서부터 잡는 편이 빠릅니다. 넥스트젠AI는 제조, 유통, 공공, 커머스 등 여러 산업의 AI 전환 프로젝트에서 같은 질문을 다뤄 왔습니다. 현재 업무 흐름과 데이터 상태를 기준으로 무엇을 먼저 할지 정리해 드립니다. 무료 AX 진단을 신청하세요.
같은 말은 아닙니다. LLM은 기술 범주이고, ChatGPT는 LLM을 대화형 서비스로 만든 제품 중 하나입니다. 같은 LLM 위에 여러 제품이 올라갈 수 있습니다.
RELATED · 함께 읽으면 좋은 글