Vertex Transcribe Služba
Prehľad prípadu
Platforma na spracovanie médií poháňaná umelou inteligenciou navrhnutá na spracovanie miliónov minút audio a video obsahu. Spracúva záznamy z pedagogických prednášok — v aramejčine a angličtine — a premieňa ich na čistý, formátovaný text s riadnym skriptom, diakritikou, overenými odkazmi a časovanými titulkami. Keď príde video súbor, systém ho automaticky detekuje, extrahuje audio stopu a posiela ju cez ten istý transkripčný proces.
Cieľ: Vybudovať mediálnu linku schopnú spracovať milióny minút obsahu a dodať text pripravený na publikovanie, titulky a HLS streamy - s čo najmenším manuálnym zásahom. spracovať audio aj video cez jediný proces, transkribovať viacjazyčný obsah s vysokou presnosťou a dynamicky škálovať na Kubernetes, aby zvládla dávky s 300+ súbežnými záznamami.
Kľúčové informácie o projekte
Priemysly
Vzdelávacie obsahové platformy, náboženské inštitúcie, mediálne vydavateľstvá, spoločnosti e-learningu, archívy prednášok, akademické knižnice obsahu.
Služby
AI transkripcia, spracovanie videa, extrakcia zvuku, HLS kódovanie s viacerými bitovými rýchlosťami, generovanie titulkov, dávková orchestrácia, overovanie zdrojových odkazov, doručenie cloudového úložiska, generovanie náhľadov a ukážok.
Riešenia
Jednotná audio/video linka, automatická detekcia formátu, viacjazyčná transkripcia, konverzia skriptu s diakritikou, delenie na základe ticha, zlučovanie časových pečiatok, overovanie náboženských zdrojov, dynamický výber AI modelu.
Technológie
Python, FastAPI, Google Vertex AI, Gemini Pro, Gemini Flash, Gemini Flash-Lite, FFmpeg, FFprobe, AWS S3, Google Cloud Storage, Kubernetes, Helm, Docker, ARM Inštancie, HLS (m3u8), Async Python, Connection Pooling, CI/CD Pipeline.
Výzvy
Proces
Každý súbor — či už surový audiozáznam prednášky alebo celý videozáznam — prechádza jediným automatizovaným procesom. Osem postupných etáp ho prevedie od surového vstupu k výstupu pripravenému na publikovanie, pričom spracovanie videa beží paralelne, aby sa nič nečakalo navzájom.
Detekcia a príprava médií
FFprobe identifikuje, či je súbor audio alebo video. Pri videu sa audio stopa automaticky extrahuje. Analýza trvania a formátu potom určí stratégiu spracovania.
Delenie audia na základe ticha
Súbory dlhšie ako 20 minút sa rozdelia na časti v prirodzených bodoch ticha, aby nebola žiadna fráza prerušená v polovici vety, čo umožňuje paralelnú transkripciu všetkých častí súčasne.
AI transkripcia
Každá časť je poslaná do Gemini Pro alebo Flash — vybrané podľa dĺžky obsahu — so štruktúrovanou schémou, ktorá núti model vracať časované texty so štítkami rečníkov.
Zlučovanie časovej osi
Všetky prepisované časti sú pospájané späť s korektným časovým posunom do jediného plynulého dokumentu s 99 % presnosťou časovej synchronizácie naprieč celým záznamom.
Post-processing textu
Surový prepis prechádza konverziou skriptu, aplikáciou diakritiky, čistením formátovania a overovaním citácií náboženských zdrojov voči externým databázam.
Spracovanie videa (paralelne)
Kým prebieha transkripcia, video modul spracováva HLS kódovanie s viacerými bitovými rýchlosťami, generovanie náhľadov, tvorbu ukážok a spracovanie viacerých audio streamov cez FFmpeg.
Generovanie titulkov a zhrnutia
Z finálneho overeného textu sa generujú časované súbory titulkov (.vtt / .srt) spolu s automatickým metadátovým zhrnutím pre obsahovú knižnicu.
Cloudové doručenie
Všetko — prepis, titulky, zhrnutie, HLS streamy — sa nahráva do AWS S3 s odkazmi doručenými tímu pre obsah. 100% zachovanie dát aj pri výpadkoch pripojenia.
Riešenia
Kľúčové prvky riešenia
Jednotná audio a video linka — FFprobe automaticky rozpoznáva formáty. Jeden vstupný bod spracuje MP4, MKV, WebM, MOV a audio bez manuálnej konverzie.
Viacjazyčné AI prepisovanie — Spracováva nahrávky v angličtine, aramejčine a zmiešaných jazykoch s promptovaním, ktoré zachováva jazykové hranice a používa správne skriptové konvencie.
Dynamický výber AI modelu — Úrovne Pro, Flash a Flash-Lite sú automaticky vyberané podľa dĺžky súboru a typu obsahu — maximalizujú presnosť a zároveň minimalizujú náklady na API.
HLS streamovanie s viacerými bitovými rýchlosťami — Paralelné spracovanie videa generuje adaptívne bitové prúdy, náhľadové snímky a klipy pripravené pre moderný video prehrávač.
300+ súbežných dávkových úloh — Kubernetes-native asynchrónna architektúra spracuje veľké dávky bez blokovania. Helm charts riadia nasadenie a škálovanie na ARM inštanciách.
Výsledky v číslach
99%
Presnosť pre audio obsah v angličtine a aramejčine so správnym skriptom a automaticky aplikovanými diakritikami.
300+
Úlohy prepisovania spracovávané súčasne so smart manažmentom fronty a adaptívnym spätným odkladom.
60%
Úspora vďaka dynamickému výberu modelu — ľahšie modely automaticky spracovávajú krátke obsahy.
100%
Žiadna strata dát ani počas výpadkov pripojenia, s automatickou synchronizáciou po obnovení spojenia.