Vertex Transcribe Service
Přehled případu
Mediální platforma pro zpracování poháněná umělou inteligencí, navržená pro zpracování milionů minut audio a video obsahu. Převádí nahrávky vzdělávacích přednášek — v aramejštině a angličtině — do čistého, formátovaného textu s vhodným písmem, diakritikou, ověřenými odkazy a časovanými titulky. Když přijde video soubor, systém ho automaticky detekuje, extrahuje zvukovou stopu a vede ji stejným přepisovacím procesem.
Cíl: Vybudovat mediální procesní řetězec schopný zpracovat miliony minut obsahu a dodat text, titulky a HLS streamy připravené k publikaci - s co nejmenším manuálním zásahem. Zpracovávat audio i video jedním řetězcem, přepisovat obsah ve více jazycích s vysokou přesností a dynamicky škálovat na Kubernetes, aby bylo možné zvládnout dávky 300+ současných nahrávek.
Klíčové informace o projektu
Odvětví
Platformy pro vzdělávací obsah, náboženské instituce, mediální vydavatelství, e-learningové společnosti, archivy přednášek, akademické knihovny obsahu.
Služby
Přepisování pomocí AI, zpracování videa, extrakce zvuku, vícestupňové kódování HLS, generování titulků, dávková orchestraci, ověřování zdrojových odkazů, doručení cloudového úložiště, generování miniatur a náhledů.
Řešení
Jednotný audio/video řetězec, automatická detekce formátu, vícejazyčný přepis, konverze skriptu s diakritikou, dělení na části dle ticha, spojování časových značek, ověřování náboženských odkazů, dynamický výběr AI modelů.
Technologie
Python, FastAPI, Google Vertex AI, Gemini Pro, Gemini Flash, Gemini Flash-Lite, FFmpeg, FFprobe, AWS S3, Google Cloud Storage, Kubernetes, Helm, Docker, ARM instance, HLS (m3u8), Async Python, connection pooling, CI/CD pipeline.
Výzvy
Proces
Každý soubor — ať už syrová audio přednáška nebo celé video — prochází jedním automatizovaným řetězcem. Osm sekvenčních fází ho přemění ze syrového vstupu na výstup připravený k publikaci, přičemž zpracování videa běží paralelně, takže nic nečeká na nic.
Detekce a příprava médií
FFprobe identifikuje, zda je soubor audio nebo video. U videa se zvuková stopa automaticky extrahuje. Analýza délky a formátu pak určuje strategii zpracování.
Dělení zvuku podle ticha
Soubory delší než 20 minut jsou rozděleny do úseků v přirozených tichých bodech, aby žádná fráze nebyla přerušena uprostřed věty, což umožňuje paralelní přepis všech částí současně.
AI přepisování
Každý úsek je odeslán do Gemini Pro nebo Flash — vybraného podle délky obsahu — s ustrukturovaným schématem, které nutí model vrátit časově označený text s označením mluvčího.
Spojování časové osy
Všechny přepsané části jsou spojeny s korektními časovými posuny do jednoho plynulého dokumentu s 99% přesným časovým sladěním v celém záznamu.
Post-processing textu
Syrový přepis prochází konverzí písma, aplikací diakritiky, čištěním formátu a ověřováním citací náboženských zdrojů vůči externí databázi.
Zpracování videa (paralelně)
Zatímco běží přepisování, video modul spravuje vícestupňové kódování HLS, generování miniatur, tvorbu náhledových klipů a správu vícestopého zvuku přes FFmpeg.
Generování titulků a shrnutí
Z konečného ověřeného textu jsou generovány časované titulkové soubory (.vtt / .srt) spolu s automatickým metadatovým shrnutím pro knihovnu obsahu.
Doručení přes cloud
Vše — přepis, titulky, shrnutí, HLS streamy — je nahráno do AWS S3 s odkazy dodanými týmu pro obsah. 100% zachování dat i při výpadcích připojení.
Řešení
Klíčové vlastnosti řešení
Jednotný audio & video řetězec — FFprobe automaticky rozpoznává formáty. Jediný vstupní bod zpracovává MP4, MKV, WebM, MOV a zvuk bez nutnosti ruční konverze.
Vícejazyčný AI přepis — Zpracovává záznamy v angličtině, aramejštině a smíšených jazycích s výzvami, které zachovávají jazykové hranice a aplikují správné konvence písma.
Dynamický výběr AI modelu — Úrovně Pro, Flash a Flash-Lite jsou automaticky vybírány podle délky souboru a typu obsahu — maximalizují přesnost a minimalizují náklady na API.
HLS streaming s více bitovými rychlostmi — Paralelní zpracování videa vytváří adaptivní streamy, náhledy a ukázky připravené pro jakýkoliv moderní video přehrávač.
300+ současných dávkových úloh — Nativní Kubernetes asynchronní architektura zvládá velké dávky bez blokování. Helm charts řídí nasazení a škálování na ARM instancích.
Výsledky v číslech
99%
Přesnost pro angličtinu a aramejský zvukový obsah s automatickou aplikací správného písma a diakritiky.
300+
Přepisové úlohy zpracovávány současně s inteligentním řízením fronty a adaptivním zpětným odkladem.
60%
Úspory díky dynamickému výběru modelu — lehčí modely automaticky zpracovávají kratší obsah.
100%
Žádná ztráta dat ani během výpadků připojení, s automatickou synchronizací po obnovení spojení.