네이티브 멀티모달(Native Multimodal) 파이프라인
Gemini는 별도의 OCR(광학 문자 인식)이나 음성 텍스트 변환(STT) 엔진 없이도, 이미지 파일과 mp3 오디오, PDF 문서를 원본 파일 그대로 받아들여 내부 딥러닝 층에서 즉시 해석합니다.
Python SDK 오디오 & PDF 파싱 코드 예시
import google.generativeai as genai
genai.configure(api_key="YOUR_API_KEY")
# 1. 대용량 오디오 및 PDF 파일 업로드
audio_file = genai.upload_file(path="meeting_recording.mp3")
pdf_file = genai.upload_file(path="annual_report_2026.pdf")
# 2. Gemini 1.5 Pro 모델 생성
model = genai.GenerativeModel(model_name="gemini-1.5-pro")
# 3. 동시 질문 파싱
response = model.generate_content([
audio_file,
pdf_file,
"회의 녹음본과 연간 보고서를 비교하여 올해 마케팅 예산 변경점 3가지를 요약해주세요."
])
print(response.text)
💡 핵심 Gemini AI 용어 사전 (Glossary)
- File API: Gemini API에서 20MB 이상의 대용량 비디오, 오디오, PDF 파일을 임시 업로드하여 관리하는 전용 파일 처리 API.
- OCR (Optical Character Recognition): 이미지나 PDF 스캔 문서 속에 들어있는 텍스트를 인공지능이 자동으로 인식하여 추출하는 기술.
- Native Processing: 외부 변환 과정 없이 모델 자체의 신경망이 다종 입력 데이터를 직접 파싱하는 특성.
멀티모달 체크리스트
- [ ] 대용량 파일 전송 시
genai.upload_fileAPI를 활용했는가? - [ ] 오디오 파일의 음질과 PDF 문서의 보안 태그가 제거되었는가?