본문으로
DAY 19 2부 · 여기까지 온 길
오늘의 질문

사진과 소리를 어떻게 글자 옆에 세울까 — 보고 듣는 AI

AI가 사진을 보고 소리를 듣게 된 비결은 눈과 귀를 단 게 아니야. 사진도 소리도 작은 조각으로 쪼개서 글자 조각과 같은 줄에 세운 거야.

글은 낱말 조각으로, 사진은 격자로 자른 네모 조각으로, 소리는 아주 짧은 시간 토막으로 잘라. 잘라 놓으면 셋 다 그냥 '줄 세운 조각'이 돼.

그러면 뼈대를 새로 만들 필요가 없어. 조각들이 서로 쳐다보게 하는 트랜스포머에 그대로 넣으면 되거든. 여러 감각을 한꺼번에 다룬다고 해서 멀티모달이라고 불러.

수업 자료 슬라이드 PDF 받기 7장 · 작성자 blog.naver.com/factnotes

직접 해보기 — 글·사진·소리를 조각으로 쪼개 보기

버튼을 눌러 재료를 바꿔 봐. 무엇을 넣든 결국 조각이 줄지어 선다는 게 보이면 성공이야. 주황색은 지금 눈여겨볼 조각이야.

그림 한 장으로

재료는 셋인데 지나가는 길은 하나야.

무엇을 넣든 같은 길로 들어간다글·사진·소리들어오는 재료조각내기토막으로 자른다한 줄로나란히 줄 세우기같은 뼈대트랜스포머 하나답하기글이나 소리로처음부터 셋을 같이 배운 모델은 사진을 글로 옮겨 적는 단계를 건너뛰어서 더 빠르고 정확해.핵심: 눈과 귀를 단 게 아니라, 모든 것을 조각으로 바꿔 같은 줄에 세운 것이다
2023년엔 사진을 읽는 기능이 널리 열렸고, 2024년엔 글·사진·소리를 한 뼈대로 배운 모델이 나와 말 대답이 평균 0.32초까지 빨라졌어.

확인해보기

세 문제. 답을 고르면 바로 채점되고, 왜 그런지도 같이 나와.

오늘의 한 줄

사진도 소리도 조각으로 쪼개 줄을 세우면,
글자와 똑같은 자리에 설 수 있어.

더 알아보기

  • 사진을 읽는 기능을 널리 열면서 무엇을 조심해야 하는지까지 함께 공개한 2023년 문서 — GPT-4V(ision) System Card (OpenAI, 2023)
  • 글·사진·소리를 하나의 뼈대로 함께 배운 2024년 모델 발표 — 말 대답이 사람만큼 빨라진 지점 — Hello GPT-4o (OpenAI, 2024)
  • 내일은 모두의 모델 경쟁 — 만드는 곳이 몇 군데에서 수십 곳으로 늘어난 이야기.