Vertex Transcribe Služba

Prehľad prípadu

Platforma na spracovanie médií poháňaná umelou inteligenciou navrhnutá na spracovanie miliónov minút audio a video obsahu. Spracúva záznamy z pedagogických prednášok — v aramejčine a angličtine — a premieňa ich na čistý, formátovaný text s riadnym skriptom, diakritikou, overenými odkazmi a časovanými titulkami. Keď príde video súbor, systém ho automaticky detekuje, extrahuje audio stopu a posiela ju cez ten istý transkripčný proces.

Cieľ: Vybudovať mediálnu linku schopnú spracovať milióny minút obsahu a dodať text pripravený na publikovanie, titulky a HLS streamy - s čo najmenším manuálnym zásahom. spracovať audio aj video cez jediný proces, transkribovať viacjazyčný obsah s vysokou presnosťou a dynamicky škálovať na Kubernetes, aby zvládla dávky s 300+ súbežnými záznamami.

Image

Kľúčové informácie o projekte

Priemysly

Priemysly

Vzdelávacie obsahové platformy, náboženské inštitúcie, mediálne vydavateľstvá, spoločnosti e-learningu, archívy prednášok, akademické knižnice obsahu.

Služby

Služby

AI transkripcia, spracovanie videa, extrakcia zvuku, HLS kódovanie s viacerými bitovými rýchlosťami, generovanie titulkov, dávková orchestrácia, overovanie zdrojových odkazov, doručenie cloudového úložiska, generovanie náhľadov a ukážok.

Riešenia

Riešenia

Jednotná audio/video linka, automatická detekcia formátu, viacjazyčná transkripcia, konverzia skriptu s diakritikou, delenie na základe ticha, zlučovanie časových pečiatok, overovanie náboženských zdrojov, dynamický výber AI modelu.

Technológie

Technológie

Python, FastAPI, Google Vertex AI, Gemini Pro, Gemini Flash, Gemini Flash-Lite, FFmpeg, FFprobe, AWS S3, Google Cloud Storage, Kubernetes, Helm, Docker, ARM Inštancie, HLS (m3u8), Async Python, Connection Pooling, CI/CD Pipeline.

Výzvy

Zložitosť zmiešaných jazykov

Zložitosť zmiešaných jazykov

Zvuk prechádza medzi aramejčinou, angličtinou a inými jazykmi v priebehu nahrávania. Bola potrebná špeciálna AI výzva a viacstupňové spracovanie textu na správne aplikovanie diakritiky a formátovania.

Video a audio v jednej linke

Video a audio v jednej linke

Systém musel spracovať ako čisté audio, tak aj video kontajnery. Automatická detekcia založená na FFprobe extrahuje audio stopu z akéhokoľvek video formátu pred spracovaním — bez zásahu používateľa.

Škálovanie pre milióny minút

Škálovanie pre milióny minút

Navrhnuté od základu pre masívny objem: úplne asynchrónne, paralelné a Kubernetes-native s riadnym manažmentom zdrojov na zvládanie nárastov dávok.

Inteligentné delenie pre dlhé prednášky

Inteligentné delenie pre dlhé prednášky

Prednášky často presahujú hodinu. Delenie na základe detekcie ticha súbory prirodzene rozdelí, zatiaľ čo zlučovanie časových pečiatok rekonštruuje plynulý, kontinuálny časový rámec bez medzier alebo prekryvov.

Inteligentný retry systém pre AI úlohy

Inteligentný retry systém pre AI úlohy

Stovky súbežných AI úloh tlačia limity poskytovateľov na maximum. Inteligentná logika opakovaní, adaptívne exponenciálne odstupy a manažment fronty udržiavajú linku v chode bez strát úloh.

Výber AI modelu pre efektívnosť nákladov

Výber AI modelu pre efektívnosť nákladov

Tri úrovne AI modelov — výkonný, rýchly a ľahký — sú dynamicky vyberané na základe dĺžky a zložitosti obsahu, čo prináša až o 60 % nižšie náklady na API pri kratšom obsahu.

Proces

Každý súbor — či už surový audiozáznam prednášky alebo celý videozáznam — prechádza jediným automatizovaným procesom. Osem postupných etáp ho prevedie od surového vstupu k výstupu pripravenému na publikovanie, pričom spracovanie videa beží paralelne, aby sa nič nečakalo navzájom.

Detekcia a príprava médií

Detekcia a príprava médií

FFprobe identifikuje, či je súbor audio alebo video. Pri videu sa audio stopa automaticky extrahuje. Analýza trvania a formátu potom určí stratégiu spracovania.

Delenie audia na základe ticha

Delenie audia na základe ticha

Súbory dlhšie ako 20 minút sa rozdelia na časti v prirodzených bodoch ticha, aby nebola žiadna fráza prerušená v polovici vety, čo umožňuje paralelnú transkripciu všetkých častí súčasne.

AI transkripcia

AI transkripcia

Každá časť je poslaná do Gemini Pro alebo Flash — vybrané podľa dĺžky obsahu — so štruktúrovanou schémou, ktorá núti model vracať časované texty so štítkami rečníkov.

Zlučovanie časovej osi

Zlučovanie časovej osi

Všetky prepisované časti sú pospájané späť s korektným časovým posunom do jediného plynulého dokumentu s 99 % presnosťou časovej synchronizácie naprieč celým záznamom.

Post-processing textu

Post-processing textu

Surový prepis prechádza konverziou skriptu, aplikáciou diakritiky, čistením formátovania a overovaním citácií náboženských zdrojov voči externým databázam.

Spracovanie videa (paralelne)

Spracovanie videa (paralelne)

Kým prebieha transkripcia, video modul spracováva HLS kódovanie s viacerými bitovými rýchlosťami, generovanie náhľadov, tvorbu ukážok a spracovanie viacerých audio streamov cez FFmpeg.

Generovanie titulkov a zhrnutia

Generovanie titulkov a zhrnutia

Z finálneho overeného textu sa generujú časované súbory titulkov (.vtt / .srt) spolu s automatickým metadátovým zhrnutím pre obsahovú knižnicu.

Cloudové doručenie

Cloudové doručenie

Všetko — prepis, titulky, zhrnutie, HLS streamy — sa nahráva do AWS S3 s odkazmi doručenými tímu pre obsah. 100% zachovanie dát aj pri výpadkoch pripojenia.

Riešenia

Kľúčové prvky riešenia

  • Jednotná audio a video linka FFprobe automaticky rozpoznáva formáty. Jeden vstupný bod spracuje MP4, MKV, WebM, MOV a audio bez manuálnej konverzie.

  • Viacjazyčné AI prepisovanie — Spracováva nahrávky v angličtine, aramejčine a zmiešaných jazykoch s promptovaním, ktoré zachováva jazykové hranice a používa správne skriptové konvencie.

  • Dynamický výber AI modelu — Úrovne Pro, Flash a Flash-Lite sú automaticky vyberané podľa dĺžky súboru a typu obsahu — maximalizujú presnosť a zároveň minimalizujú náklady na API.

  • HLS streamovanie s viacerými bitovými rýchlosťami — Paralelné spracovanie videa generuje adaptívne bitové prúdy, náhľadové snímky a klipy pripravené pre moderný video prehrávač.

  • 300+ súbežných dávkových úloh — Kubernetes-native asynchrónna architektúra spracuje veľké dávky bez blokovania. Helm charts riadia nasadenie a škálovanie na ARM inštanciách.

Image

Výsledky v číslach

Presnosť prepisu

99%

Presnosť pre audio obsah v angličtine a aramejčine so správnym skriptom a automaticky aplikovanými diakritikami.

Súbežné úlohy

300+

Úlohy prepisovania spracovávané súčasne so smart manažmentom fronty a adaptívnym spätným odkladom.

Nižšie náklady na API

60%

Úspora vďaka dynamickému výberu modelu — ľahšie modely automaticky spracovávajú krátke obsahy.

Ukladanie dát

100%

Žiadna strata dát ani počas výpadkov pripojenia, s automatickou synchronizáciou po obnovení spojenia.

Máte na spracovanie milióny minút? Poďme vytvoriť pipeline!

Povedzte nám o svojom obsahu alebo si dohodnite bezplatnú konzultáciu – navrhneme riešenie prispôsobené vašej škále, jazykom a požiadavkám na dodanie.

Message not sent.
Message not sent.
×
Nie ste si istí, kde začať? Pomôžeme vám načrtnúť ďalšie kroky!
×
Máte výzvu? Náš tím ju premení na riešenie.
Súhlas so spracovaním osobných údajov