AI는 언어 기반 모델이라고 이야기 했다. 근데, 글 말고 다른것도 이해하고 다른 아웃풋도 만들어내고 있는 AI이다. 나는 이런 일들을 주로 AI와 한다.
만들던 PPT 캡쳐해서 이 슬라이드 에 대해 피드백해봐 라고 했다.
회의 자료 PDF 첨부해서 요약하고 빠진 거 짚어줘 시켰다.
손으로 그린 와이어프레임 사진 찍어서 이거 깔끔한 도식으로 만들어줘 했다.
퇴근하면서 음성으로 영어 회화 연습했다.
이걸 멀티모달(Multimodal) 이라고 한다.
멀티모달이 뭐야?
모달(modal)은 입력 종류라는 뜻이다. 글, 이미지, 음성, 영상. 이게 다 모달이다. AI는 한 가지 모달만 다뤘다. 글만, 이미지만, 음성만. 그래서 따로따로 도구를 써야 했다. 글 요약은 ChatGPT, 이미지는 그림 그리는 도구, 음성은 받아쓰기 도구. 멀티모달은 그걸 다 한 모델이 처리하는 거다. 글, 사진, 음성파일을 이해하고, 답도 글, 이미지, 음성으로 생성한다.
요즘 우리가 쓰는 Claude, GPT, Gemini 다 멀티모달 모델이다.
AI는 이미지를 어떻게 보나? 그리고 왜 이미지를 읽으면 토큰이 녹을까?
AI는 글을 토큰이라는 단위로 본다고 이전에 말했다. 이미지도 똑같다. AI는 이미지를 작은 조각들로 잘라서, 그걸 토큰으로 바꿔서 본다. 그래서 이미지를 업로드하면 토큰 사용량 쭉 올라가서 컨텍스트 윈도우 다 차버리기도 한다. 이미지 한 장이 글 수백 줄에 해당하는 토큰을 사용하기도 한다고 한다.
근데 이게 신기한 건 AI한테는 글이든 이미지든 음성이든 결국 다 토큰이라는 점이다. 모달이 달라도 처리하는 방식은 같다.
멀티모달로 더 똑똑하게 AI를 써보자!
옮겨 적을 필요가 없다. 예전엔 종이 메모나 화이트보드 사진을 보고 직접 타이핑해서 AI한테 넘겼다. 찍어서 바로 올리자. 대신 이미지 인식이 잘 될정도로 적어보자.
음성 대화가 가능해지면서 걸어가면서도, 손에 다른 거 들고 있어도, 많은 양의 대화도 빠르게 AI랑 일이 굴러간다.
도구 사이를 안 옮겨다닌다. 글은 ChatGPT, 그림은 다른 도구, 받아쓰기는 또 다른 도구로 옮겨다닐 필요가 없다. 한 곳에서 다 된다.
결국 AI한테 던지는 게 자연스러워진다. 이걸 어떻게 글로 설명하지 고민할 필요 없이, 그냥 사진 찍어서 던지면 끝. AI랑 일하는 진입 장벽이 확 낮아진다.
정리하면
멀티모달 : 글·이미지·음성·영상을 한 모델이 다 다룬다.
우리가 이미 다 쓰고 있다. 사진, 음성, PDF파일 컨텍스트 윈도우에 드래그앤 드롭 하는게 다 멀티모달을 사용하고 있었던것!
AI한테는 모달이 달라도 결국 다 토큰이다.
토큰을 많이 먹는 게 단점. 글로 풀어쓸 수 있다면 글로 작성해보자.