요즘 LLM 종류 정말 많다. Claude, Gemini, ChatGPT, 거기다 Grok, LLaMA, DeepSeek까지. 어떤 걸 써야 하는지도 헷갈리는데, 더 헷갈리는 게 있다. 같은 Claude를 쓰는데도 답의 퀄리티가 매번 다르다.
어제는 만족스러웠던 답이 오늘은 이상하다. 같은 질문을 다시 던졌는데도. AI가 멍청해진건가? 아니다. 모델 선택창을 다시 보자. Claude.ai를 켜면 Opus 4.7, Sonnet 4.6, Haiku 4.5가 떠있다. 거기에 "extended thinking" 토글까지 있다.
내가 모르고 매번 다른 걸 쓰고 있었던 거다. 어제는 Opus, 오늘은 Sonnet. 어제는 thinking 켜고, 오늘은 그냥. 답이 다른 게 당연하다. 그러니까 LLM의 기본적인 것들을 알았다면, 내가 지금 어떤 모델을, 어떤 모드로 쓰고 있는지 그 차이와 이유를 알아보자.
모델이 뭐야?
Claude도 모델이고, GPT도 모델이고, Gemini도 모델이다. 회사들은 모델을 한 번 만들면 끝이 아니라 계속 새 버전을 내놓는다. Claude 3, Claude 3.5, Claude 4, Claude 4.6, Claude 4.7. 이렇게 세대가 올라간다. 핸드폰 새 모델 나오는 거랑 비슷하다.
그런데 모델이 한 종류가 아니더라 = 하위 모델
같은 회사가 같은 시점에 모델을 한 개만 내놓는 게 아니다. 크기와 용도가 다른 모델 여러 개를 같이 운영한다. 이게 하위 모델이다.
Claude를 예를들어본다. Claude는 세 가지 모델이 있고, 차이는 똑똑함,속도,가격(토큰 사용량) 세 가지가 같이 움직인다.
Opus : 가장 똑똑함. 가장 느림. 토큰이 녹는걸 경험할 수 있음.
Sonnet : 적당히 똑똑함. 적당히 빠름.
Haiku : 덜 똑똑함. 매우 빠름.
Opus 4.7은 Opus 하위 모델의 4.7버전라는 뜻이다. 하위모델 + 버전를 한 번에 읽어야 한다.
필요한 상황에 적절한 모델을 사용하면 효율적이다.
그리고 thinking 모드까지
답하기 전에 먼저 생각하는 모드가 추가됐다. Claude는 extended thinking, GPT는 reasoning이라 부른다.
일반 모드 : 질문 받자마자 바로 답을 만든다.
thinking 모드 : 답하기 전에 한참 생각한다. 문제를 분석하고, 여러 경로를 따져보고, 그 다음에 답을 낸다.
잠깐, 생각 좀 해볼게 라고 하고 좀 기다리면 결과 퀄리티가 높아진다. 근데, 이것도 토큰이 문제다.
오늘 저녁 메뉴 추천해줘 같은 간단한 질문보다 같이 고민하고 사고의 확장이 필요하고 논의가 필요한 것에 thinking mode를 켜면 좋다.
클로드한테 직접 물어본 클로드의 thinking 모드
이게 정확히 어떻게 돌아가는 건지 궁금해서 클로드한테 직접 물어봤다. (이게 가능한 시대다)
요약하면 이렇다.
답을 뱉기 전에 생각하는 토큰을 먼저 사용한다.
LLM은 단어를 하나씩 이어붙이는 기계다. 답 전에 머릿속 풀이를 토큰으로 적은 다음, 그걸 자기가 읽으면서 답을 만든다. 종이에 풀이 적으면서 푸는 사람이랑 비슷하다.
우리에겐 요약본만 보인다.
thinking 옆에 펼침 버튼이 있다. 거기 들어가면 일부가 보인다.
요즘은 모델이 알아서 판단한다.
질문 보고 이건 추론 필요하다고 판단하면 순간순간 thinking mode가 켜진다.
그래서 너 지금 thinking 쓰고 있어? 물었더니 클로드 답이 재밌었다. 쓰고 있는데, 얼마나 쓰는지는 안 느껴져요. 사람이 무의식적으로 추론하는 것처럼요.
그래서 답이 매번 다른 이유 : 오늘 갑자기 멍청해진게 아니다.
처음 질문으로 돌아가자. 왜 답의 퀄리티가 매번 달랐을까.
어제는 Opus + thinking으로 답했는데, 오늘은 Sonnet으로 답했을 수 있다.
같은 Sonnet이라도 thinking을 켰을 때와 안 켰을 때 답이 다르다.
Haiku로 어려운 질문 던지면, 빠르지만 결이 얕은 답이 온다.
답이 별로다 싶을 때 가장 먼저 확인할 건 프롬프트가 아니라 지금 어떤 모델을, 어떤 모드로 쓰고 있는지 보기를 바란다.
정리하면
모델 = AI 그 자체. 회사들이 계속 새 버전을 낸다.
하위 모델 = ex) Claude는 Opus / Sonnet / Haiku.
thinking 모드 = 답하기 전에 생각하는 모드. 어려운 문제엔 강력, 쉬운 문제엔 낭비.
답이 매번 다른 건 모델·모드가 다르기 때문이다. AI 탓하기 전에 모델부터 확인하자.