음성파일 텍스트 변환은 파일을 넣고 문장을 매끄럽게 만드는 작업으로 끝나지 않습니다. 먼저 업로드 한도와 지원 형식을 확인하고, 화자·시간 정보가 필요한지에 따라 전사 방식을 고른 뒤, 원음과 대조한 내용만 정리본에 반영해야 합니다. 긴 녹음일수록 원본 전사와 편집본을 분리해야 잘못 들은 이름·숫자·부정 표현이 자연스러운 문장으로 굳는 일을 줄일 수 있습니다.
이 글을 위해 실제 녹음 파일을 업로드하거나 전사 정확도·작업 시간을 측정하지 않았습니다. 2026년 9월 11일 직접 연 OpenAI, Google Docs, YouTube, Google Drive 공식 문서에서 확인되는 값과 기능 범위만 사용합니다. 따라서 특정 정확도, 권장 비트레이트, “1시간 녹음을 몇 분에 끝낸다” 같은 결과값은 제시하지 않습니다.
광고나 제휴 여부와 무관하게 아래 공개 자료를 참고했습니다.
이 글에서 직접 확인한 공식 자료
OpenAI 문서에서는 파일 전사의 크기·형식, 화자 구분과 타임스탬프 조건을 확인했고, Whisper 공개 저장소에서는 긴 파일을 처리하는 30초 창의 의미를 대조했습니다. Google Docs는 브라우저·언어 범위를, YouTube는 자동 자막 언어와 자막 파일 규격을, Google Drive는 저장·미리보기 범위를 각각 확인했습니다.
- OpenAI File transcription — 25MB, 입력 형식 7종, 화자 구분·타임스탬프·긴 입력 조건.
- OpenAI Whisper 공개 저장소 —
transcribe()의 슬라이딩 30초 창. - Google Docs: Type & edit with your voice — 지원 브라우저, 한국어 음성 입력, 영어 전용 음성 명령.
- YouTube: Use automatic captioning — 한국어 자동 자막 지원과 생성 실패 후보.
- YouTube: Supported subtitle and closed caption files — SRT·SBV·WebVTT 규격.
- Google Drive: Files you can store in Google Drive — 일반 파일 저장 한도와 오디오 미리보기 형식.
공식 문서의 확인값과 원문 항목명
| 구분 | 확인한 값·정의 | 공식 원문 항목명 | ⭐ 적용상 주의 |
|---|---|---|---|
| OpenAI 파일 한도 | 파일당 최대 25MB |
File transcription — “Files can be up to 25 MB” | 25분이나 1시간 같은 재생 시간 한도가 아니며, 25MB 이하가 정확도나 처리 성공을 보장한다는 뜻도 아님 |
| OpenAI 입력 형식 | mp3, mp4, mpeg, mpga, m4a, wav, webm |
File transcription — Supported input formats | 확장자만 바꾸면 실제 코덱까지 변환된다는 뜻이 아니며, Google Drive 미리보기 형식과도 같은 목록이 아님 |
| 25MB 초과 입력 | 압축 형식을 쓰거나 25MB 이하 조각으로 나누고, 문장 중간 분할을 피하라고 안내 |
Longer inputs | 공식 권장 비트레이트가 제시된 것은 아니며, 조각마다 문맥이 자동 보존된다는 뜻도 아님 |
| Whisper 처리 창 | transcribe()가 파일 전체를 읽고 슬라이딩 30초 창으로 처리 |
Python usage — “sliding 30-second window” | 오픈소스 Whisper가 30초짜리 파일만 받는다는 뜻이 아니며, API의 25MB 업로드 제한과도 별개 |
| 화자 구분 모델 | gpt-4o-transcribe-diarize; diarized_json에 speaker, start, end 구간 제공 |
Speaker diarization | 일반 파일 전사용 기본 추천 모델이 아니며, 화자 이름이나 발화 내용을 항상 맞힌다는 보장이 아님 |
| 화자 구분 긴 입력 | 30초 초과 오디오는 chunking_strategy="auto" 또는 VAD 구성 필요 |
Speaker diarization — audio longer than 30 seconds | 30초가 파일 업로드 상한이라는 뜻이 아니며, 자동 청킹이 화자 전환 오류를 없앤다는 뜻도 아님 |
| 알려진 화자 참조 | 최대 4개, 각 참조 음성 2~10초 |
known_speaker_names[], known_speaker_references[] |
참조를 넣었다고 모든 구간의 신원을 확정할 수 있다는 뜻이 아니며, 참조 음성 사용 권한 확인도 별도 |
| 단어·구간 타임스탬프 | whisper-1의 timestamp_granularities[]로 단어 또는 구간 타임스탬프 요청 |
Timestamps | 모든 전사 모델에 같은 매개변수가 적용된다는 뜻이 아니며, 타임스탬프가 발화 내용의 정확성을 증명하지 않음 |
| Google Docs 브라우저 | 최신 Chrome, Edge, Safari |
Type & edit with your voice — “latest versions of” | 모든 브라우저·구버전에서 동작한다는 뜻이 아니며, 조직 관리자가 기능을 꺼 둘 수 있음 |
| Google Docs 언어 | 음성 입력 목록에 Korean 포함; 편집용 음성 명령은 영어만 지원 |
Languages that work with voice typing / Voice commands | 한국어 음성 입력 지원이 한국어 편집 명령 지원을 뜻하지 않음. 구두점도 모든 언어에서 제공된다고 보장하지 않음 |
| YouTube 자동 자막 | 긴 형식 동영상·Shorts의 지원 언어 목록에 Korean 포함 |
Automatic captions on long-form videos and Shorts | 업로드 즉시 생성되거나 오류 없이 전사된다는 뜻이 아님. 여러 오디오 트랙이면 기본 언어 자막만 자동 생성 |
| YouTube 기본 자막 파일 | .srt, .sbv/.sub는 plain UTF-8; 기본 버전만 지원하고 스타일 마크업은 인식하지 않음 |
Basic file formats — SubRip / SubViewer | 자막 파일을 올리면 원음의 오인식까지 교정되는 것이 아니며, 스타일 정보가 유지된다는 뜻도 아님 |
| YouTube WebVTT | .vtt; 위치 지정 지원, 스타일은 <b>, <i>, <u>로 제한 |
Advanced file formats — WebVTT | CSS 클래스나 임의 스타일이 보존된다는 뜻이 아니며, 일반 회의록 저장 형식과는 목적이 다름 |
| Google Drive 저장 | 일반 파일은 최대 5TB; 모든 파일 형식 저장 가능 |
All other files / Supported file types | 계정의 실제 저장 공간을 초과할 수 있다는 뜻이 아니며, 저장 가능이 전사·재생·미리보기 가능을 뜻하지 않음 |
| Drive 오디오 미리보기 | MP3, MPEG, WAV, .ogg, .opus |
General files — Audio formats | 미리보기 목록은 업로드 허용 목록이나 OpenAI 입력 형식 목록이 아님. 목록에 없는 m4a도 Drive에 저장할 수 없다는 뜻이 아님 |
조건에 따라 전사 경로를 고르는 판단 기준표
| 조건 | 선택 | 이유 |
|---|---|---|
| 마이크로 말하면서 문서에 바로 받아쓰려는 경우 | 지원 브라우저의 Google Docs Voice typing | 공식 절차가 작동 중인 마이크 입력을 전제로 함. 녹음 파일 일괄 업로드 기능으로 설명된 문서는 아님 |
| 완성된 녹음 파일이 25MB 이하이고 화자표가 필요 없는 경우 | OpenAI 일반 파일 전사 경로 | 공식 문서는 일반 녹음 전사에는 gpt-transcribe부터 시작하라고 안내하고, 화자 전용 모델은 별도 목적이라고 구분함 |
| 누가 말했는지 구간별 표지가 필요한 경우 | gpt-4o-transcribe-diarize와 diarized_json |
speaker, start, end가 있는 구간 응답을 받는 공식 경로임 |
| 단어·구간 타임스탬프가 편집의 핵심인 경우 | whisper-1과 timestamp_granularities[] |
공식 문서가 이 매개변수를 whisper-1 전용으로 구분함 |
| 파일이 25MB를 넘는 경우 | 지원 압축 형식으로 바꾸거나 25MB 이하로 분할 | Transcriptions API의 파일당 한도를 먼저 충족해야 함. 문장 중간 분할은 피함 |
| 영상이 이미 YouTube에 있고 접근성 자막이 필요한 경우 | 자동 자막 생성 여부를 확인한 뒤 원음으로 검수 | 한국어가 지원되지만 자동 자막 품질은 달라질 수 있고 검토·수정을 공식 문서가 요구함 |
| YouTube에 교정된 자막을 다시 올리는 경우 | 기본 타이밍이면 UTF-8 .srt 또는 .sbv, 위치 지정이 필요하면 .vtt |
파일별 지원 범위가 다르므로 회의록 문서를 그대로 올리는 것보다 자막 목적 형식으로 내보내야 함 |
| 대용량 원본을 보관만 하려는 경우 | Drive 저장 범위와 계정 잔여 공간을 확인 | Drive의 5TB는 일반 파일 저장 상한이며 전사 서비스 한도를 늘려 주지 않음 |
25MB와 30초를 섞지 않는 긴 파일 처리
25MB는 OpenAI Transcriptions API의 파일 업로드 한도입니다. 반면 30초는 오픈소스 Whisper의 transcribe()가 파일을 내부적으로 처리하는 슬라이딩 창이며, 화자 구분 모델에서는 긴 입력의 청킹 설정을 결정하는 기준으로도 등장합니다. “Whisper는 30초까지만 가능하다” 또는 “25MB면 몇 시간이든 동일하게 처리된다”로 바꾸면 서로 다른 문서의 항목을 잘못 합친 설명이 됩니다.
25MB를 넘으면 먼저 원본을 보존하고 작업용 복사본만 압축하거나 분할합니다. 확인한 공식 문서에는 모든 긴 음성에 공통으로 적용할 단일 권장 비트레이트가 없습니다. 음성의 길이·채널 수·코덱에 따라 같은 재생 시간도 크기가 달라지므로, 실제 파일 크기를 기준으로 판단하고 분할점은 문장이나 발언 전환 사이에 둡니다. 각 조각에는 파일명과 원본 시작 시각을 남겨 합친 뒤 시간을 역산할 수 있게 합니다. 마지막 두 문장은 긴 입력 안내를 실무에 적용한 편집 절차이며, 측정 결과가 아닙니다.
화자 분리 결과를 이름 확정으로 취급하지 않는 방법
화자 구분이 필요하면 일반 Whisper 기반 서비스에 옵션이 있을 것이라고 가정하지 말고, 사용 중인 모델과 응답 형식을 확인합니다. OpenAI 공식 경로에서는 gpt-4o-transcribe-diarize와 diarized_json을 사용하며, 30초가 넘는 녹음에는 chunking_strategy 설정이 필요합니다. 알려진 화자를 연결하려면 최대 4개의 2~10초 참조 음성을 제공할 수 있지만, 이 수치는 화자 인식 정확도나 식별 보증값이 아닙니다.
정리본에서는 자동 라벨을 먼저 화자 A, 화자 B처럼 유지합니다. 실제 이름으로 바꾸는 구간은 원음이나 참석자 정보로 확인된 경우로 제한하고, 확정하지 못한 라벨은 그대로 둡니다. 겹쳐 말한 구간은 한 사람의 문장으로 매끄럽게 합치지 말고 [겹침 00:24:15]처럼 재확인 지점을 남깁니다.
전사본과 정리본을 분리하는 후처리 순서
- 원본 전사 보존: 모델이 반환한 텍스트·화자 라벨·시간 정보를 수정하지 않은 사본으로 남깁니다.
- 고위험 표현 대조: 인명·회사명·제품명, 숫자·날짜·금액, “한다/안 한다” 같은 부정 표현, 결정·담당·기한이 걸린 문장을 원음과 대조합니다.
- 불명확 표시: 들리지 않는 말을 추정해 채우지 않고
[불명확 00:31:08]처럼 원음 위치를 남깁니다. - 표기 통일: 확인된 고유명사만 찾아 바꾸고, 말버릇 삭제나 문장 재배열은 편집본에서만 수행합니다.
- 용도별 분리: 원문 인용이 필요한 녹취록, 읽기 쉽게 다듬은 정리본, 결정·액션 아이템 요약을 서로 다른 층으로 둡니다.
- 배포 전 확인: 녹음·외부 전사 서비스 업로드·화자 참조 음성 사용이 조직의 동의와 정보 취급 규칙에 맞는지 확인합니다.
이 순서는 모든 문장을 같은 강도로 검수하라는 뜻이 아닙니다. 판단을 바꾸는 이름·수치·부정·책임 구간을 원음에 연결하고, 확인하지 않은 부분을 자연스러운 문장으로 덮지 않는 것이 목적입니다.
증상 → 원인 후보 → 확인 → 조치
| 증상 | 원인 후보 | 확인할 항목 | 조치 |
|---|---|---|---|
| OpenAI 파일 전사가 업로드 단계에서 거부됨 | 25MB 초과 또는 지원 목록 밖의 실제 형식 | 바이트 단위 파일 크기, 확장자가 아닌 실제 컨테이너·코덱 | 원본은 보존하고 지원 형식의 25MB 이하 작업본으로 압축하거나 문장 사이에서 분할 |
| 화자 라벨이 응답에 없음 | 일반 전사 모델 사용 또는 응답 형식 불일치 | 모델 ID, response_format, 30초 초과 시 chunking_strategy |
화자 구분이 정말 필요할 때만 전용 모델과 diarized_json으로 다시 요청 |
| 화자 이름이 바뀌거나 겹친 발화가 한 사람에게 붙음 | 화자 전환·동시 발화 구간 또는 미확인 자동 라벨 | speaker/start/end 구간과 해당 원음 |
중요 구간만 원음 대조 후 이름을 확정하고, 불명확하면 화자 문자와 겹침 표시 유지 |
| 분할 경계에서 문장이 끊기거나 뜻이 달라짐 | 문장 중간 분할로 앞뒤 문맥 손실 | 앞 조각 끝과 다음 조각 시작의 원음·시간 | 발언 사이에서 다시 나누거나 경계 구간을 겹쳐 검수하되 중복 문장은 수동 정리 |
| Google Docs에서 한국어 받아쓰기는 되지만 편집 명령이 작동하지 않음 | 음성 입력 언어와 영어 전용 음성 명령 범위 혼동 | 계정·문서 언어, 브라우저 버전, 관리자 비활성화 여부 | 한국어는 받아쓰기에 쓰고 편집은 키보드로 진행. 영어 음성 명령 조건을 한국어 지원으로 확대 해석하지 않음 |
| YouTube 자동 자막이 생성되지 않거나 늦음 | 지원 언어, 긴 동영상, 낮은 음질, 시작부 긴 무음, 겹치는 화자·다중 언어, 처리 대기 | 동영상 기본 언어와 YouTube 도움말의 문제 해결 항목 | 기본 언어·오디오를 확인하고 기다린 뒤, 자동 자막이 없으면 교정한 자막 파일을 별도로 업로드 |
| SRT를 올렸더니 글꼴·위치 스타일이 사라짐 | SRT 기본 형식의 스타일 미지원 | 자막 파일 확장자와 필요한 스타일·위치 정보 | 기본 자막이면 plain UTF-8 SRT를 유지하고, 위치가 필요하면 WebVTT 지원 범위 안에서 작성 |
| Drive에는 저장됐지만 브라우저에서 재생 미리보기가 안 됨 | 저장 가능 형식과 미리보기 지원 형식 혼동 | Drive의 Supported file types와 Audio formats 목록 | 보관 성공과 미리보기 성공을 분리해 기록하고, 전사 입력은 선택한 전사 서비스의 지원 형식으로 별도 준비 |
공식 문서에 명시되지 않은 값과 이번 검증 경계
| 항목 | 판정 | 본문 처리 |
|---|---|---|
| 공통 전사 정확도 또는 화자 분리 정확도 | 확인한 공식 문서에 단일 보장값 명시 없음 | 정확도 백분율과 “완벽한 분리” 표현을 쓰지 않음 |
| 긴 회의에 공통으로 최적인 비트레이트·샘플레이트 | 확인한 공식 문서에 단일 권장값 명시 없음 | 근거 없는 고정값을 제거하고 실제 파일 크기와 지원 형식으로 판단 |
| 1시간 파일의 고정 처리 시간·절약 시간 | 확인한 공식 문서에 명시 없음 | 기존 20분 완료 주장을 제거 |
| YouTube 자동 자막의 고정 생성 시간·긴 동영상의 정확한 상한 | 확인한 공식 문서에 숫자 명시 없음 | 처리 복잡도와 실패 후보만 기재하고 임의 시간을 만들지 않음 |
| Google Docs 녹음 파일 직접 업로드 | 확인한 도움말 절차에 명시 없음 | 작동 중인 마이크를 쓰는 받아쓰기 경로로만 설명 |
| 실제 파일 업로드·전사·화자 식별·시간 측정 | 미실행·미측정 | 실험·관찰 완료형 표현과 성능 단정을 쓰지 않음 |
| 본문에 연결한 공식 문서 6건 | 접근 성공 | 2026-09-11 원문 본문에서 항목명과 적용 범위를 직접 대조 |
| 로컬 품질 검사의 외부 출처 요청 | DNS 차단 | 본문 조사 접근 성공과 구분하며, 외부출처 검사 실패만 검증 예외로 기록 |
배포 직전 확인할 최소 체크리스트
- 원본 오디오와 수정하지 않은 원본 전사본이 남아 있는가?
- 25MB·30초·2~10초·4개가 각각 파일 한도, 처리 창, 참조 길이, 참조 개수임을 섞지 않았는가?
- 이름·숫자·날짜·부정·결정·담당·기한을 원음과 대조했는가?
- 확정하지 못한 화자와 문장을 추정하지 않고 표시했는가?
- 자막으로 배포한다면 UTF-8과 선택한 파일 형식의 스타일 범위를 확인했는가?
- 요약이나 액션 아이템을 전사 원문처럼 제시하지 않았는가?
전사 후 회의 내용을 실행 항목으로 바꾸려면 STT 녹취를 액션 아이템으로 정리하는 절차를 이어서 적용할 수 있습니다. 이 링크는 전사 정확도를 높이는 도구 설명이 아니라, 확인된 녹취에서 결정·담당·기한을 분리하는 다음 단계입니다.