멀티모달 AI란? 사진·문서·음성을 보여줄 때 확인할 것
텍스트만 입력하는 AI와 사진이나 음성을 함께 보내는 AI는 질문하는 방법이 다릅니다. 사진을 올렸다고 해서 AI가 사진 속 모든 글자를 정확히 읽는 것은 아니고, 음성 파일을 넣었다고 해서 모든 서비스가 같은 방식으로 처리하는 것도 아닙니다.
멀티모달 AI는 서로 다른 종류의 입력을 처리하는 모델 또는 기능을 가리킵니다. Google Gemini 공식 문서는 텍스트·이미지·오디오·비디오를 함께 넣는 방식을 멀티모달 프롬프트라고 설명합니다.[2] OpenAI와 Anthropic의 현재 개발자 문서는 이미지 입력을 받아 분석하는 기능을 각각 설명합니다.[1][3]

입력 종류별로 할 수 있는 일
| 입력 | AI가 다룰 수 있는 정보 | 초보자가 시도할 질문 | 먼저 확인할 점 |
|---|---|---|---|
| 텍스트 | 문장, 숫자, 표의 내용 | “이 안내문에서 신청 마감일만 찾아줘” | 문서의 기준일과 원문 |
| 이미지 | 사진 속 물체, 배치, 문서의 시각 정보 | “이 사진에서 교체해야 할 부품을 표시해줘” | 글자 크기, 초점, 개인정보 |
| 음성 | 말의 내용과 소리의 흐름 | “이 녹음에서 할 일을 시간순으로 정리해줘” | 화자 동의, 주변 대화, 지원 형식 |
| 비디오 | 장면 변화와 시간 순서 | “10초부터 20초 사이에 일어난 일을 설명해줘” | 서비스가 영상 입력을 지원하는지 |
이 표의 ‘할 수 있는 일’은 서비스의 모델, 앱, 파일 형식에 따라 달라집니다. 같은 회사의 제품이라도 웹 앱과 API의 지원 범위가 다를 수 있으므로 업로드 버튼이 보이는지, 공식 문서에 해당 입력 형식이 적혀 있는지를 따로 확인해야 합니다. Google은 이미지 입력에 URL, 인라인 데이터, Files API 업로드라는 방법을 안내하고, 큰 파일이나 여러 요청에서 다시 쓸 파일에는 Files API를 권장합니다.[2]
사진을 올릴 때 질문을 구체적으로 쓰기
사진만 올리고 “이게 뭐야?”라고 묻는 것보다 확인할 대상을 정하는 편이 낫습니다. 다음처럼 쓰면 답변을 검토하기 쉽습니다.
사진에서 보이는 포트의 개수를 세고, 확실히 보이지 않는 포트는 ‘확인 불가’라고 적어줘. 사진에서 읽은 내용과 추정한 내용을 나눠서 써줘.
작은 글씨, 반사광, 가려진 부분은 별도로 표시하라고 요청하세요. 영수증이나 신분증 사진처럼 개인정보가 들어간 파일은 업로드 전에 이름, 주소, 전화번호, 바코드를 가리는 것이 안전합니다. 회사 문서라면 서비스의 저장·학습·접근 정책을 먼저 읽고, 허용된 파일만 넣어야 합니다.
OpenAI의 이미지 입력 문서는 PNG, JPEG, WEBP, 비애니메이션 GIF를 지원 입력으로 적고 있으며, 요청 전체의 이미지 용량과 개수에도 제한을 둡니다. 이 문서에 적힌 현재 제한은 총 payload 512MB, 요청당 최대 1,500장입니다.[1] 이 수치는 이미지 분석 품질을 보장하는 점수가 아니라 API 요청 제한이므로, 실제 사용 전에는 모델별 최신 문서를 다시 확인해야 합니다.
문서 사진과 원문을 구분하기
문서 사진을 요약할 때는 AI가 읽은 문장을 원문과 대조해야 합니다. 다음 순서가 실용적입니다.
- 문서 전체 사진을 먼저 올리고 문서의 제목, 작성일, 개정일을 확인합니다.
- 필요한 표나 문단을 가까이 찍어 다시 올립니다.
- AI에게 숫자와 날짜를 표로 옮기게 한 뒤, 원본에서 각 값을 직접 대조합니다.
- 출처 파일의 버전과 적용 날짜를 답변 옆에 기록합니다.
사진 속 표가 흐리거나 일부가 잘렸다면 숫자를 채워 달라고 하지 말고 확인 불가라고 적게 하세요. AI가 만든 표는 원문을 대신하지 않습니다.

음성과 영상은 지원 범위를 먼저 보기
음성이나 영상을 올리는 기능은 모든 모델에 기본으로 들어 있는 기능이 아닙니다. Google의 공식 문서는 텍스트·이미지·오디오·비디오를 함께 사용하는 멀티모달 프롬프트를 설명하지만, 개별 모델과 제품의 입력 조건은 따로 확인해야 합니다.[2] 따라서 파일 선택창에 오디오가 보이지 않거나 모델 문서에 영상 입력이 없다면, 파일을 억지로 변환하기보다 지원되는 모델을 선택해야 합니다.
회의 녹음에는 참석자 동의와 보관 정책이 먼저입니다. AI에게 요약을 맡길 때도 원본 녹음의 보관 위치, 자동 삭제 시점, 다른 사람이 접근할 수 있는지를 확인하세요. 영상 속 얼굴과 화면에는 음성보다 더 많은 개인정보가 함께 들어갈 수 있습니다.
Anthropic의 Claude API 문서는 이미지를 base64 데이터, 온라인 URL, Files API의 file_id 중 하나로 전달할 수 있다고 설명합니다. 다만 Bedrock과 Google Cloud 환경에서는 당시 문서 기준으로 base64 방식만 사용할 수 있다고 적혀 있습니다.[3] 같은 모델 이름을 보더라도 어디에서 호출하는지에 따라 파일 전달 방법이 달라질 수 있다는 뜻입니다.
세 공식 문서에서 확인되는 범위
| 문서 | 확인되는 입력과 방법 | 수치 또는 조건 |
|---|---|---|
| OpenAI Images and vision | 이미지 입력 분석, 이미지 URL 예시 | PNG·JPEG·WEBP·비애니메이션 GIF, 총 512MB payload, 요청당 최대 1,500장[1] |
| Google Gemini Image understanding | 이미지 이해, URL·인라인 데이터·Files API | 큰 파일이나 반복 사용에는 Files API 권장[2] |
| Anthropic Claude Vision | 이미지 content block, base64·URL·file_id | Bedrock·Google Cloud에서는 base64만 가능하다고 문서에 표시[3] |
이 표는 2026년 8월 30일에 확인한 개발자 문서의 기능 설명을 옮긴 것입니다. 세 서비스의 답변 정확도를 같은 사진으로 측정한 직접 비교 자료는 이 글에서 사용하지 않았습니다. 제품과 API의 제한은 바뀔 수 있으므로, 실제 업로드 전에 사용하는 모델의 문서를 다시 확인하세요.
초보자용 입력 전 점검표
- 사진이나 녹음에 다른 사람의 개인정보가 들어 있는지 확인합니다.
- 파일을 받는 모델과 API가 해당 형식을 지원하는지 확인합니다.
- 질문에 “보이는 사실”, “추정”, “확인 불가”를 나눠 적어 달라고 요청합니다.
- 숫자, 날짜, 제품명은 원문과 대조합니다.
- 중요한 결정에 사용할 답변은 공식 문서나 담당자에게 다시 확인합니다.
AI가 이미지를 분석할 수 있다는 사실은 답변이 항상 맞다는 뜻이 아닙니다. Google 공식 문서도 생성형 AI의 출력이 부정확하거나 편향될 수 있으므로 후처리와 사람의 평가가 필요하다고 안내합니다.[2]
자주 묻는 질문
멀티모달 AI면 사진 속 글자를 모두 읽을 수 있나요?
아닙니다. 해상도, 초점, 글자 크기, 기울기, 반사광에 따라 읽지 못할 수 있습니다. 필요한 부분을 가까이 찍고, 읽지 못한 값은 확인 불가로 표시하라고 요청하세요.
사진을 올리면 AI가 사진 속 내용을 계속 기억하나요?
사용 중인 제품의 대화 기록, 파일 보관, 학습 사용 정책을 확인해야 합니다. API와 웹 앱의 보관 방식이 같다고 가정하지 말고, 민감한 정보는 가린 뒤 허용된 환경에서만 업로드하세요.
이미지와 음성을 함께 보내면 답변이 더 정확해지나요?
입력 하나가 빠뜨린 정보를 다른 입력이 보완할 수는 있지만, 정확도가 자동으로 올라간다고 단정할 공식 비교 수치는 없습니다. 이미지와 음성의 출처가 서로 맞는지, 모델이 두 입력을 모두 지원하는지, 답변이 원문과 일치하는지를 확인해야 합니다.
최종 확인일: 2026년 8월 30일 (KST)