오늘의 질문
사진과 소리를 어떻게 글자 옆에 세울까 — 보고 듣는 AI
AI가 사진을 보고 소리를 듣게 된 비결은 눈과 귀를 단 게 아니야. 사진도 소리도 작은 조각으로 쪼개서 글자 조각과 같은 줄에 세운 거야.
글은 낱말 조각으로, 사진은 격자로 자른 네모 조각으로, 소리는 아주 짧은 시간 토막으로 잘라. 잘라 놓으면 셋 다 그냥 '줄 세운 조각'이 돼.
그러면 뼈대를 새로 만들 필요가 없어. 조각들이 서로 쳐다보게 하는 트랜스포머에 그대로 넣으면 되거든. 여러 감각을 한꺼번에 다룬다고 해서 멀티모달이라고 불러.
직접 해보기 — 글·사진·소리를 조각으로 쪼개 보기
버튼을 눌러 재료를 바꿔 봐. 무엇을 넣든 결국 조각이 줄지어 선다는 게 보이면 성공이야. 주황색은 지금 눈여겨볼 조각이야.
그림 한 장으로
재료는 셋인데 지나가는 길은 하나야.
확인해보기
세 문제. 답을 고르면 바로 채점되고, 왜 그런지도 같이 나와.
오늘의 한 줄
사진도 소리도 조각으로 쪼개 줄을 세우면,
글자와 똑같은 자리에 설 수 있어.
더 알아보기
- 사진을 읽는 기능을 널리 열면서 무엇을 조심해야 하는지까지 함께 공개한 2023년 문서 — GPT-4V(ision) System Card (OpenAI, 2023)
- 글·사진·소리를 하나의 뼈대로 함께 배운 2024년 모델 발표 — 말 대답이 사람만큼 빨라진 지점 — Hello GPT-4o (OpenAI, 2024)
- 내일은 모두의 모델 경쟁 — 만드는 곳이 몇 군데에서 수십 곳으로 늘어난 이야기.