쏘냐 · 주간 콘텐츠

AI 첫걸음 11편 : 멀티모달

셩PM · 2026-05-20
이미지, 음성, 파일까지 이제 모든걸 다 읽을 수 있지!

AI는 언어 기반 모델이라고 이야기 했다. 근데, 글 말고 다른것도 이해하고 다른 아웃풋도 만들어내고 있는 AI이다. 나는 이런 일들을 주로 AI와 한다.

만들던 PPT 캡쳐해서 이 슬라이드 에 대해 피드백해봐 라고 했다.

회의 자료 PDF 첨부해서 요약하고 빠진 거 짚어줘 시켰다.

손으로 그린 와이어프레임 사진 찍어서 이거 깔끔한 도식으로 만들어줘 했다.

퇴근하면서 음성으로 영어 회화 연습했다.

이걸 멀티모달(Multimodal) 이라고 한다.


멀티모달이 뭐야?

Gemini_Generated_Image_7bnust7bnust7bnu.png

모달(modal)은 입력 종류라는 뜻이다. 글, 이미지, 음성, 영상. 이게 다 모달이다. AI는 한 가지 모달만 다뤘다. 글만, 이미지만, 음성만. 그래서 따로따로 도구를 써야 했다. 글 요약은 ChatGPT, 이미지는 그림 그리는 도구, 음성은 받아쓰기 도구. 멀티모달은 그걸 다 한 모델이 처리하는 거다. 글, 사진, 음성파일을 이해하고, 답도 글, 이미지, 음성으로 생성한다.

요즘 우리가 쓰는 Claude, GPT, Gemini 다 멀티모달 모델이다.

Gemini_Generated_Image_elmyorelmyorelmy.png


AI는 이미지를 어떻게 보나? 그리고 왜 이미지를 읽으면 토큰이 녹을까?

AI는 글을 토큰이라는 단위로 본다고 이전에 말했다. 이미지도 똑같다. AI는 이미지를 작은 조각들로 잘라서, 그걸 토큰으로 바꿔서 본다. 그래서 이미지를 업로드하면 토큰 사용량 쭉 올라가서 컨텍스트 윈도우 다 차버리기도 한다. 이미지 한 장이 글 수백 줄에 해당하는 토큰을 사용하기도 한다고 한다.

근데 이게 신기한 건 AI한테는 글이든 이미지든 음성이든 결국 다 토큰이라는 점이다. 모달이 달라도 처리하는 방식은 같다.


멀티모달로 더 똑똑하게 AI를 써보자!

옮겨 적을 필요가 없다. 예전엔 종이 메모나 화이트보드 사진을 보고 직접 타이핑해서 AI한테 넘겼다. 찍어서 바로 올리자. 대신 이미지 인식이 잘 될정도로 적어보자.

음성 대화가 가능해지면서 걸어가면서도, 손에 다른 거 들고 있어도, 많은 양의 대화도 빠르게 AI랑 일이 굴러간다.

도구 사이를 안 옮겨다닌다. 글은 ChatGPT, 그림은 다른 도구, 받아쓰기는 또 다른 도구로 옮겨다닐 필요가 없다. 한 곳에서 다 된다.

결국 AI한테 던지는 게 자연스러워진다. 이걸 어떻게 글로 설명하지 고민할 필요 없이, 그냥 사진 찍어서 던지면 끝. AI랑 일하는 진입 장벽이 확 낮아진다.


정리하면

멀티모달 : 글·이미지·음성·영상을 한 모델이 다 다룬다.

우리가 이미 다 쓰고 있다. 사진, 음성, PDF파일 컨텍스트 윈도우에 드래그앤 드롭 하는게 다 멀티모달을 사용하고 있었던것!

AI한테는 모달이 달라도 결국 다 토큰이다.

토큰을 많이 먹는 게 단점. 글로 풀어쓸 수 있다면 글로 작성해보자.