Služba Vertex Transcribe

Prehľad prípadu

Mediálna platforma so strojovým učením, ktorá spracováva milióny minút zvukového a video obsahu. Preberá záznamy vzdelávacích prednášok — v aramejčine a angličtine — a premieňa ich na čistý, formátovaný text so správnym písmom, diakritikou, overenými odkazmi a časovanými titulkami. Keď dorazí video súbor, systém ho automaticky rozpozná, extrahuje zvukovú stopu a posiela ju rovnakou prepisovacou cestou.

Cieľ: Vybudovať mediálny procesný kanál schopný spracovať milióny minút obsahu a dodať text pripravený na publikáciu, titulky a HLS streamy - s čo najmenšou manuálnou prácou. Spracovať zvuk aj video jedným kanálom, prepisovať viacjazyčný obsah s vysokou presnosťou a dynamicky škálovať na Kubernetes pre spracovanie dávok 300+ súbežných záznamov.

Image

Kľúčové informácie o projekte

Odvetvia

Odvetvia

Vzdelávacie obsahové platformy, náboženské inštitúcie, mediálne vydavateľstvá, e-learningové spoločnosti, archívy prednášok, akademické knižnice obsahu.

Služby

Služby

AI prepisovanie, spracovanie videa, extrakcia zvuku, HLS kódovanie s viacerými prenosovými rýchlosťami, generovanie titulkov, orchestrácia dávok, overovanie zdrojových odkazov, doručovanie cez cloudové úložisko, tvorba náhľadov a ukážok.

Riešenia

Riešenia

Zjednotený audio/video kanál, automatická detekcia formátu, viacjazyčné prepisovanie, konverzia písma s diakritikou, delenie podľa ticha, spájanie časových pečiatok, overovanie náboženských odkazov, dynamický výber AI modelov.

Technológie

Technológie

Python, FastAPI, Google Vertex AI, Gemini Pro, Gemini Flash, Gemini Flash-Lite, FFmpeg, FFprobe, AWS S3, Google Cloud Storage, Kubernetes, Helm, Docker, ARM inštancie, HLS (m3u8), Async Python, Connection Pooling, CI/CD pipeline.

Výzvy

Komplexnosť zmiešaných jazykov

Komplexnosť zmiešaných jazykov

Zvuk prechádza medzi aramejčinou, angličtinou a inými jazykmi počas záznamu. Bola potrebná špeciálna AI stimulácia a viacstupňové spracovanie textu na správnu aplikáciu diakritiky a formátovania.

Video a zvuk v jednom kanáli

Video a zvuk v jednom kanáli

Systém musel spracovať čistý zvuk aj video kontajnery. Automatická detekcia založená na FFprobe extrahuje zvukový prúd z akéhokoľvek video formátu pred spracovaním — bez nutnosti zásahu používateľa.

Škálovanie pre milióny minút

Škálovanie pre milióny minút

Navrhnuté od základu pre obrovský objem: plne asynchrónne, paralelné a natívne pre Kubernetes s riadnym manažmentom zdrojov na zvládanie výkyvov v záťaži dávok.

Inteligentné delenie dlhých prednášok

Inteligentné delenie dlhých prednášok

Prednášky často presahujú hodinu. Delenie podľa ticha súbory prirodzene rozdeľuje, zatiaľ čo spájanie časových pečiatok rekonštruuje plynulú časovú líniu bez medzier alebo prekryvov.

Inteligentný systém opakovaní pre AI úlohy

Inteligentný systém opakovaní pre AI úlohy

Stovky súbežných AI úloh silno zaťažujú poskytovateľa. Inteligentná logika opakovaní, adaptívny exponenciálny spätný odskok a manažment fronty zabezpečujú plynulý chod kanála bez vynechaných úloh.

Výber AI modelu pre efektívnosť nákladov

Výber AI modelu pre efektívnosť nákladov

Tri úrovne AI modelov — výkonný, rýchly a ľahký — sa dynamicky vyberajú na základe dĺžky a zložitosti obsahu, čo prináša až o 60 % nižšie náklady na API pri kratšom obsahu.

Proces

Každý súbor — či už surová zvuková prednáška alebo kompletný video záznam — prechádza jedným automatizovaným kanálom. Osem po sebe idúcich fáz zmení surový vstup na výstup pripravený na publikáciu, pričom spracovanie videa prebieha paralelne, takže nič na nič nečaká.

Detekcia médií a príprava

Detekcia médií a príprava

FFprobe identifikuje, či je súbor zvukový alebo video. Pre video sa zvuková stopa automaticky extrahuje. Následná analýza trvania a formátu určuje stratégiu spracovania.

Delenie zvuku podľa ticha

Delenie zvuku podľa ticha

Súbory dlhšie ako 20 minút sa delia na časti na prirodzených miestach ticha tak, aby sa žiadna veta neprestrihla uprostred, čo umožňuje paralelný prepis všetkých častí súčasne.

AI prepisovanie

AI prepisovanie

Každý diel je odoslaný do Gemini Pro alebo Flash — vyberaných podľa dĺžky obsahu — s štruktúrovaným schématom, ktorý núti model vrátiť text s časovými pečiatkami a označením rečníkov.

Spájanie časovej osi

Spájanie časovej osi

Všetky prepisované časti sú správne časovo poskladané do jedného plynulého dokumentu, s 99 % presnou synchronizáciou časových pečiatok na celom zázname.

Post-procesovanie textu

Post-procesovanie textu

Surový prepis prechádza konverziou písma, aplikáciou diakritiky, vyčistením formátovania a overovaním náboženských citácií proti vonkajšej databáze.

Spracovanie videa (paralelne)

Spracovanie videa (paralelne)

Kým prepis beží, video modul rieši HLS kódovanie s viacerými prenosovými rýchlosťami, tvorbu náhľadov, tvorbu ukážkových klipov a spracovanie viacerých zvukových stôp cez FFmpeg.

Generovanie titulkov a súhrnu

Generovanie titulkov a súhrnu

Z finálneho overeného textu sa generujú časované titulkové súbory (.vtt / .srt) spolu s automatickým metadátovým súhrnom pre knižnicu obsahu.

Doručenie cez cloud

Doručenie cez cloud

Všetko — prepisy, titulky, súhrn, HLS streamy — sa nahráva na AWS S3 a odkazy sa doručujú tímu obsahu. 100 % uchovanie dát aj pri výpadkoch spojenia.

Riešenia

Kľúčové vlastnosti riešenia

  • Zjednotený audio a video pipeline FFprobe automaticky rozpoznáva formáty. Jeden vstupný bod spracováva MP4, MKV, WebM, MOV a audio bez manuálnej konverzie.

  • Multijazyčné AI prepisovanie — Spracúva nahrávky v angličtine, aramejčine a zmiešaných jazykoch s výzvami, ktoré zachovávajú jazykové hranice a aplikujú správne konvencie písma.

  • Dynamický výber AI modelu — Profesionálne, Flash a Flash-Lite úrovne sa automaticky vyberajú podľa dĺžky súboru a typu obsahu — maximalizujú presnosť a minimalizujú náklady na API.

  • HLS multibitová streamingová služba — Paralelné spracovanie videa vytvára adaptívne streamy s rôznou bitovou rýchlosťou, náhľady a ukážky pripravené pre akýkoľvek moderný video prehrávač.

  • 300+ paralelných dávkových úloh — Kubernetes-natívna asynchrónna architektúra spracováva veľké dávky bez blokovania. Helm charts riadia nasadenie a škálovanie na ARM inštanciách.

Image

Výsledky v číslach

Presnosť prepisu

99%

Presnosť pre anglický a aramejský zvukový obsah so správnym písmom a diakritikou aplikovanou automaticky.

Paralelné úlohy

300+

Prepisové úlohy spracovávané súčasne so smart správou čakacej rady a adaptívnym spätným odrazom.

Nižšie náklady na API

60%

Úspory vďaka dynamickému výberu modelu — ľahšie modely automaticky spracujú kratší obsah.

Ukladanie dát

100%

Žiadna strata dát ani pri prerušení spojenia, s automatickou synchronizáciou po obnovení spojenia.

Máte na spracovanie milióny minút? Poďme vytvoriť pipeline!

Povedzte nám o svojej výzve s obsahom alebo si rezervujte bezplatnú konzultáciu - načrtneme riešenie prispôsobené vašemu rozsahu, jazykom a požiadavkám na dodanie.

Message not sent.
Message not sent.
×
Nie ste si istí, kde začať? Pomôžeme vám načrtnúť ďalšie kroky!
×
Máte výzvu? Náš tím ju premení na riešenie.
Súhlas so spracovaním osobných údajov