Služba přepisu Vertex
Přehled případu
Mediální platforma založená na umělé inteligenci navržená pro zpracování milionů minut audio a video obsahu. Zpracovává nahrávky vzdělávacích přednášek – v aramejštině a angličtině – a převádí je na čistý, formátovaný text se správným skriptem, diakritikou, ověřenými odkazy a časovými titulky. Když přijde video soubor, systém jej automaticky detekuje, extrahuje zvukovou stopu a směruje ji přes stejnou transkripční pipeline.
Cíl: Vytvořit mediální pipeline schopnou zpracovávat miliony minut obsahu a dodávat text připravený k publikaci, titulky a HLS streamy - s co nejmenší manuální prací. Zpracovávat jak zvuk, tak video přes jedinou pipeline, přepisovat vícejazyčný obsah s vysokou přesností a dynamicky škálovat na Kubernetes pro zvládnutí dávek s více než 300 souběžnými nahrávkami.
Klíčové informace o projektu
Odvětví
Platformy vzdělávacího obsahu, náboženské instituce, mediální vydavatelství, společnosti e-learningu, archivy přednášek, akademické knihovny.
Služby
Přepis pomocí AI, zpracování videa, extrakce zvuku, HLS kódování s více bitrate, generování titulků, orchestrace dávek, ověřování zdrojových odkazů, doručování cloudového úložiště, generování náhledů a miniatur.
Řešení
Jednotná audio/video pipeline, automatická detekce formátu, vícejazyčný přepis, konverze skriptu s diakritikou, dělení na části podle ticha, spojování časových značek, ověřování náboženských odkazů, dynamický výběr AI modelů.
Technologie
Python, FastAPI, Google Vertex AI, Gemini Pro, Gemini Flash, Gemini Flash-Lite, FFmpeg, FFprobe, AWS S3, Google Cloud Storage, Kubernetes, Helm, Docker, ARM instance, HLS (m3u8), Async Python, Connection Pooling, CI/CD pipeline.
Výzvy
Proces
Každý soubor – ať už surová audio přednáška nebo plná video nahrávka – prochází jedinou automatizovanou pipeline. Osm po sobě jdoucích fází vede od surového vstupu až po výstup připravený k publikaci, přičemž zpracování videa běží paralelně, takže nic nečeká na nic jiného.
Detekce a příprava médií
FFprobe určuje, zda je soubor audio nebo video. U videa se automaticky extrahuje zvuková stopa. Analýza délky a formátu pak určuje strategii zpracování.
Dělení zvuku podle ticha
Soubory delší než 20 minut se dělí na části na přirozených místech ticha, aby žádná fráze nebyla přerušena uprostřed věty, což umožňuje paralelní přepis všech částí zároveň.
Přepis pomocí AI
Každá část je poslána do Gemini Pro nebo Flash – vybrané podle délky obsahu – se strukturovaným schématem, které nutí model vracet časově označený text s popisky mluvčích.
Spojování časové osy
Všechny přepsané části jsou zpět spojeny s korektními časovými posuny do jednoho plynulého dokumentu s 99% přesností zarovnání časových značek v celé nahrávce.
Post-processing textu
Surový přepis prochází konverzí skriptu, aplikací diakritiky, čištěním formátování a ověřováním náboženských citací vůči externí databázi.
Zpracování videa (paralelně)
Zatímco probíhá přepis, video modul zajišťuje HLS kódování s více bitrate, generování náhledů, tvorbu ukázkových klipů a zpracování více zvukových stop přes FFmpeg.
Generování titulků a shrnutí
Z konečného ověřeného textu jsou generovány časové soubory titulků (.vtt / .srt) spolu s automatickým metadatovým shrnutím pro knihovnu obsahu.
Cloudové doručení
Vše – přepis, titulky, shrnutí, HLS streamy – se nahraje do AWS S3 a odkazy jsou doručeny týmu zabývajícímu se obsahem. 100% uchování dat i při výpadcích připojení.
Řešení
Klíčové vlastnosti řešení
Jednotný audio a video kanál — FFprobe automaticky detekuje formáty. Jeden vstupní bod zpracovává MP4, MKV, WebM, MOV a audio bez nutnosti manuální konverze.
Vícejazyčný AI přepis — Zpracovává záznamy v angličtině, aramejštině a ve smíšených jazycích s výzvami, které zachovávají jazykové hranice a aplikují správné konvence písem.
Dynamický výběr AI modelu — Profesionální, Flash a Flash-Lite úrovně jsou vybírány automaticky podle délky souboru a typu obsahu — maximalizují přesnost při minimalizaci nákladů na API.
HLS streamování s více bitovými rychlostmi — Paralelní zpracování videa vytváří adaptivní streamy, náhledové miniatury a ukázkové klipy připravené pro jakýkoli moderní video přehrávač.
300+ současných dávkových úloh — Kubernetes-native asynchronní architektura zvládá velké dávky bez zablokování. Helm grafy spravují nasazení a škálování na ARM instancích.
Výsledky v číslech
99%
Přesnost pro audio obsah v angličtině a aramejštině s automatickou aplikací správného písma a diakritiky.
300+
Úlohy přepisu zpracovávány současně s inteligentním řízením fronty a adaptivním zpomalováním.
60%
Úspory díky dynamickému výběru modelu — lehčí modely automaticky zpracovávají kratší obsah.
100%
Žádná ztráta dat ani při výpadcích připojení, s automatickou synchronizací po obnovení spojení.