본문으로
2부 · 여기까지 온 길 중급 DAY 11–20 총정리

2부 총정리 — 여기까지 온 길

같은 열흘을, 왜 그런지까지 · 설명 한 겹 더 · DAY 11-20

열흘 동안 AI가 어디서 왔는지 거슬러 올라가 봤어. 여기서는 그 열흘을 한 자리에 모으고, 날마다 '왜 그런지'를 한 겹 더 풀어 쓴다.

퀴즈도 실험도 없어. 날마다 앞 문단은 초급과 같고, 뒤 문단이 한 걸음 더 들어간 이야기야.

DAY 11 · 1958 첫 인공 뉴런

뉴런 하나를 흉내 낸 첫 기계

1958년 프랭크 로젠블랫이 퍼셉트론을 만들었어. 들어온 신호마다 무게를 곱해 더하고, 합이 문턱을 넘으면 1, 못 넘으면 0을 내는 인공 뉴런 하나야. 진짜 새로웠던 건 틀리면 스스로 무게를 고쳤다는 점이야 — 규칙을 안 써 줘도 예시만 보고 배운 첫 기계였어.

지금의 거대한 AI도 뜯어보면 이 뉴런을 아주 많이 쌓고 이어 붙인 거야. '신호에 무게를 곱해 더한다'와 '틀리면 무게를 고친다', 이 두 가지는 지금도 그대로야. 그보다 15년 앞선 1943년에 매컬러와 피츠가 뉴런을 논리 연산으로 적어 낸 글이 있었지만, 스스로 배우는 기계를 실제로 만든 건 퍼셉트론이 처음이었어.

지금의 AI도 결국, 1958년 그 뉴런 하나를 아주 많이 쌓은 거야.
DAY 12 · 두 번의 AI 겨울

기대가 실력보다 앞서 가면 겨울이 온다

1969년 민스키와 페퍼트가 한 층짜리 뉴런으로는 못 푸는 문제가 있다는 걸 수학으로 증명하자, 연구비도 사람도 빠져나갔어 — 첫 번째 겨울이야. 1980년대엔 규칙을 사람이 다 적어 주는 전문가 시스템이 붐이었는데, 적어 둔 상황을 조금만 벗어나도 틀렸고 1987년엔 그 전용 컴퓨터 시장이 무너졌어 — 두 번째 겨울이야. 두 번 다 AI가 못해서가 아니라, 약속이 실력보다 앞서 갔기 때문이야.

첫 겨울의 원인은 한 층짜리의 한계였어. 층을 여러 겹 쌓으면 되지만, 여러 층일 때 어느 무게를 얼마나 고쳐야 할지 계산하는 방법이 널리 쓰이지 않았지. 1986년 네이처에 실린 역전파 논문이 층을 쌓아도 무게를 고칠 수 있다는 걸 널리 알리면서 겨울이 녹기 시작했어.

겨울이 온 건 AI가 못해서가 아니라, 약속이 실력보다 앞서 갔기 때문이야.
DAY 13 · 2012 딥러닝의 부활

세 가지가 한자리에 모인 날

2012년 사진 맞히기 대회 이미지넷에서 토론토대 팀의 신경망이 오류 15.3%로 우승했어. 2위가 26.2%였으니 10%포인트가 넘는 차이였지. 새로 발명한 건 거의 없었어 — 사진 수백만 장, 게임용 그래픽카드, 깊게 쌓은 신경망이 그해에 처음으로 한자리에 모인 거야.

이미지넷은 사진 수백만 장에 이름표를 붙여 둔 데이터베이스로 2009년에 공개됐어. 게임용 그래픽카드는 같은 계산을 한꺼번에 많이 하는 데 강해서 신경망 학습에 딱 맞았고, 우승 팀은 그래픽카드 두 장으로 5~6일을 학습시켰어. 재료가 다 갖춰지자 오래된 아이디어가 드디어 실력을 보였고, 이날 이후 사진 연구는 통째로 신경망으로 넘어갔어.

겨울을 끝낸 건 새 아이디어가 아니라, 데이터·계산·깊이가 한자리에 모인 날이었어.
DAY 14 · 2017 트랜스포머

단어들이 서로를 쳐다보기 시작했다

2017년 구글 연구팀의 논문 'Attention Is All You Need'가 지금 AI의 뼈대인 트랜스포머를 정했어. 그 전엔 문장을 앞에서부터 한 단어씩 읽었는데, 트랜스포머는 문장 속 모든 단어가 서로를 동시에 쳐다보게 했어. 동시에 본다는 건 한꺼번에 계산할 수 있다는 뜻이라, 그래픽카드와 딱 맞았지.

'동물이 길을 건너지 않았다, 그것은 너무 피곤했다'에서 '그것'은 동물이고, '너무 넓었다'로 바꾸면 길이야. 트랜스포머는 단어마다 문장 속 다른 단어를 얼마나 봐야 하는지 점수를 매겨서 이런 연결을 한 번에 찾아. 차례로 읽을 땐 멀리 떨어진 단어가 흐려졌는데, 서로 직접 쳐다보니 거리가 상관없어졌어.

단어들이 서로를 쳐다보게 했더니, AI가 문장을 통째로 이해하기 시작했어.
DAY 15 · 2020 GPT-3

키웠더니 예시만 보고 따라 했다

트랜스포머 뼈대는 그대로 두고 크게만 키웠더니, 2020년 숫자 1,750억 개짜리 GPT-3가 나왔어. 놀라운 건 다시 훈련시키지 않아도 질문 안에 예시 두세 개만 넣으면 바로 따라 했다는 거야. 이때부터 '뭐라고 시키느냐', 즉 프롬프트가 중요해졌어.

GPT-1은 약 1억 1,700만 개, GPT-2는 약 15억 개, GPT-3는 1,750억 개였어. 2018년부터 2020년 사이에 천 배 넘게 커진 셈이야. 숫자를 키우면 성능이 얼마나 오를지 미리 계산해 보는 연구가 먼저 있었고, GPT-3는 그 계산을 실제로 끝까지 밀어붙인 결과였어.

뼈대는 그대로, 크기와 읽은 글만 키웠더니 예시만 봐도 따라 하는 재주가 생겼어.
DAY 16 · 2022 ChatGPT

세상을 바꾼 건 대화창이었다

2022년 11월 30일, GPT 계열 모델을 말을 주고받는 대화창에 얹어 누구나 쓰게 연 게 ChatGPT야. 사람들이 어떤 답을 더 좋아하는지 골라 준 걸로 다시 다듬어서, 시키는 걸 제대로 알아듣게 만든 게 컸어. 그래서 이날 바뀐 건 기술보다 쓰는 사람의 범위였어.

그 다듬기 방법을 정리한 2022년 논문에서, 사람 피드백으로 다듬은 13억 개짜리 모델의 답을 사람들은 1,750억 개짜리 GPT-3의 답보다 더 좋아했어. 크기만이 답이 아니라는 신호였지. 여기에 예시를 붙일 줄 몰라도 그냥 말 걸면 되는 창이 더해지자, 그제서야 모두가 AI를 직접 만져 보게 됐어.

더 큰 모델이 아니라 말 걸 수 있는 창이 AI를 모두의 것으로 만들었어.
DAY 17 · 생각하고 답하기

답하기 전에 풀이부터

어려운 문제에서 AI가 확 잘해진 비결은 더 커진 게 아니라, 답하기 전에 풀이 단계를 밟게 한 거야. 처음엔 사람이 '단계별로 생각해 봐'라고 시켜야 했는데, 나중엔 스스로 그러도록 훈련받은 추론 모델이 나왔어. 대신 생각이 길수록 답이 늦고 글자도 많이 써서, 쉬운 질문엔 굳이 안 써.

2022년 한 논문은 질문 끝에 '단계별로 생각해 보자' 한 줄만 붙여도 수학 정답률이 크게 뛴다는 걸 보였어. 2024년엔 시키지 않아도 스스로 풀이를 쓰도록 훈련받은 모델이 나왔는데, 같은 미국 고교 수학 대회 문제에서 바로 답하던 모델은 12%, 이 모델은 74%를 맞혔어. 뼈대를 바꾼 게 아니라 답하는 차례를 바꾼 결과야.

바로 답하는 대신 풀이를 먼저 쓰게 했더니, 틀리던 문제를 맞히기 시작했어.
DAY 18 · 스스로 도구 쓰는 AI

모를 때 계산기를 집는 것

AI는 다음 낱말을 잇는 게 본업이라, 큰 곱셈이나 오늘 날씨처럼 정확히 알아야 하는 것에 약해. 그래서 계산기·검색·코드 실행 같은 도구를 붙여 줬고, 2023년부터는 언제 집을지 모델이 스스로 고르게 됐어. 잘하는 AI는 다 아는 AI가 아니라, 모른다는 걸 알아채고 도구를 집는 AI야.

질문을 받고, 도구가 필요한지 판단하고, 정해진 형식으로 도구를 부르고, 받은 결과로 답을 마무리해. 핵심은 두 번째 걸음이야 — 예전엔 사람이 '검색해 봐'라고 시켜야 했는데, 지금은 모델이 스스로 정해. 2023년 논문 툴포머는 계산기·검색·달력을 언제 부를지 모델이 스스로 배우게 했고, 같은 해 모델이 도구 이름과 값을 정해진 형식으로 말하는 기능이 공식으로 열렸어.

모른다는 걸 알아채고 도구를 집는 것도 똑똑함의 한 종류야.
DAY 19 · 보고 듣는 AI

무엇이든 조각으로 쪼개 한 줄로

AI가 사진을 보고 소리를 듣게 된 건 눈과 귀를 단 게 아니야. 사진은 격자로 자른 네모 조각으로, 소리는 아주 짧은 시간 토막으로 잘라 글자 조각과 같은 줄에 세운 거야. 그러면 뼈대를 새로 만들 필요 없이, 조각들이 서로 쳐다보게 하는 트랜스포머에 그대로 넣으면 돼.

처음엔 사진을 따로 글로 옮겨 적은 뒤 언어 모델에 넘기는 식이었어. 처음부터 글·사진·소리를 한 뼈대로 함께 배운 모델은 그 중간 단계를 건너뛰어서 더 빠르고 정확해. 2023년엔 사진을 읽는 기능이 널리 열렸고, 2024년엔 세 가지를 함께 배운 모델이 나와 말 대답이 평균 0.32초까지 빨라졌어.

사진도 소리도 조각으로 쪼개 줄을 세우면, 글자와 똑같은 자리에 설 수 있어.
DAY 20 · 모두의 모델 경쟁

쓰는 것에서 고르는 것으로

2022년 말엔 쓸 만한 대화형 AI가 손에 꼽을 정도였는데, 지금은 미국·유럽·중국·한국까지 수십 곳이 저마다 모델을 내놔. 가장 크게 바뀐 건 모델의 숫자 뭉치를 통째로 풀어, 누구나 내려받아 자기 장비에서 돌릴 수 있게 한 열린 모델이야. 그래서 지금은 하나를 쓰는 게 아니라 값·속도·잘하는 분야를 따져 골라 쓰는 시대야.

누구나 내려받을 수 있던 모델의 크기가 2023년 2월엔 650억, 그해 7월엔 700억, 2024년 7월엔 4,050억이 됐어. 1년 반 만에 여섯 배, GPT-3의 1,750억보다 큰 모델을 아무나 받게 된 거야. 2025년엔 중국 연구팀도 추론 모델을 열어 공개했어 — 열린 모델 경쟁이 한 나라의 일이 아니라는 뜻이야.

만드는 곳이 몇 군데에서 수십 곳으로 늘자, AI는 '쓰는 것'에서 '고르는 것'이 됐어.

열흘을 한 줄로 묶으면

1958년 뉴런 하나에서 출발한 이야기는, 기대가 실력보다 앞서 가 두 번 얼어붙었다가 2012년 데이터·계산·깊이가 모이면서 다시 깨어났어.

2017년 트랜스포머가 뼈대를 정한 뒤로는 뼈대를 거의 안 바꿨어. 키우고(2020), 사람 입맛에 맞게 다듬어 대화창에 얹고(2022), 답하기 전에 생각하게 하고, 도구를 쥐여 주고, 사진과 소리까지 같은 줄에 세웠지. 바뀐 건 대부분 '어떻게 쓰느냐'였어.

그 결과 지금은 비슷한 실력의 모델이 수십 개야. 3부에서는 이걸로 실제로 뭘 할 수 있는지 — 요약·번역부터 하나씩 해 본다.

더 읽어보기 / 근거
  1. Frank Rosenblatt, The Perceptron (1958) — 첫 학습하는 인공 뉴런
  2. McCulloch·Pitts, A logical calculus of the ideas immanent in nervous activity (1943)
  3. Minsky·Papert, Perceptrons (1969) — 한 층짜리의 한계
  4. Learning representations by back-propagating errors (1986) — 역전파
  5. ImageNet: A Large-Scale Hierarchical Image Database (2009)
  6. ILSVRC 2012 Results — top-5 오류 15.3%
  7. ImageNet Classification with Deep Convolutional Neural Networks (NIPS 2012)
  8. Attention Is All You Need (2017) — 트랜스포머
  9. Language Models are Few-Shot Learners (2020) — GPT-3, 1,750억 파라미터
  10. Introducing ChatGPT (OpenAI, 2022)
  11. Training language models to follow instructions with human feedback (2022) — RLHF
  12. Large Language Models are Zero-Shot Reasoners (2022) — '단계별로 생각해 보자'
  13. Learning to Reason with LLMs (OpenAI, 2024) — 12%와 74%
  14. Toolformer (2023) — 도구를 언제 부를지 스스로 배우기
  15. Function calling and other API updates (OpenAI, 2023)
  16. GPT-4V(ision) System Card (OpenAI, 2023)
  17. Hello GPT-4o (OpenAI, 2024) — 평균 0.32초 음성 응답
  18. Introducing LLaMA (Meta AI, 2023) — 650억 공개
  19. The Llama 3 Herd of Models (2024) — 4,050억 공개
  20. DeepSeek-R1 (2025) — 열린 추론 모델
하루 5분 AI 수업 · 작성자 blog.naver.com/factnotes