Vertex Transcribe Service

Přehled případu

Mediální platforma pro zpracování poháněná umělou inteligencí, navržená pro zpracování milionů minut audio a video obsahu. Převádí nahrávky vzdělávacích přednášek — v aramejštině a angličtině — do čistého, formátovaného textu s vhodným písmem, diakritikou, ověřenými odkazy a časovanými titulky. Když přijde video soubor, systém ho automaticky detekuje, extrahuje zvukovou stopu a vede ji stejným přepisovacím procesem.

Cíl: Vybudovat mediální procesní řetězec schopný zpracovat miliony minut obsahu a dodat text, titulky a HLS streamy připravené k publikaci - s co nejmenším manuálním zásahem. Zpracovávat audio i video jedním řetězcem, přepisovat obsah ve více jazycích s vysokou přesností a dynamicky škálovat na Kubernetes, aby bylo možné zvládnout dávky 300+ současných nahrávek.

Image

Klíčové informace o projektu

Odvětví

Odvětví

Platformy pro vzdělávací obsah, náboženské instituce, mediální vydavatelství, e-learningové společnosti, archivy přednášek, akademické knihovny obsahu.

Služby

Služby

Přepisování pomocí AI, zpracování videa, extrakce zvuku, vícestupňové kódování HLS, generování titulků, dávková orchestraci, ověřování zdrojových odkazů, doručení cloudového úložiště, generování miniatur a náhledů.

Řešení

Řešení

Jednotný audio/video řetězec, automatická detekce formátu, vícejazyčný přepis, konverze skriptu s diakritikou, dělení na části dle ticha, spojování časových značek, ověřování náboženských odkazů, dynamický výběr AI modelů.

Technologie

Technologie

Python, FastAPI, Google Vertex AI, Gemini Pro, Gemini Flash, Gemini Flash-Lite, FFmpeg, FFprobe, AWS S3, Google Cloud Storage, Kubernetes, Helm, Docker, ARM instance, HLS (m3u8), Async Python, connection pooling, CI/CD pipeline.

Výzvy

Složitost smíšených jazyků

Složitost smíšených jazyků

Zvuk přepíná mezi aramejštinou, angličtinou a dalšími jazyky během nahrávky. Bylo třeba speciální AI výzvy a vícestupňového zpracování textu, aby byla správně aplikována diakritika a formátování.

Video a audio v jednom řetězci

Video a audio v jednom řetězci

Systém musel zvládat jak čisté audio, tak video kontejnery. Automatická detekce založená na FFprobe extrahuje zvukový proud z libovolného video formátu před zpracováním – uživatelský zásah není potřeba.

Škálování na miliony minut

Škálování na miliony minut

Navrženo od základu pro velké objemy: plně asynchronní, paralelní a nativní pro Kubernetes se správou zdrojů pro zvládnutí špiček v dávkovém zatížení.

Chytré dělení pro dlouhý audio záznam přednášky

Chytré dělení pro dlouhý audio záznam přednášky

Přednášky často přesahují hodinu. Dělení na základě ticha přirozeně rozděluje soubory, zatímco spojování časových značek rekonstruuje nepřerušenou časovou osu bez mezer či překryvů.

Chytrý opakovací systém pro AI úlohy

Chytrý opakovací systém pro AI úlohy

Stovky současných AI úloh tlačí limity poskytovatelů. Chytrá logika opakování, adaptivní exponenciální zálohování a správa fronty udržují řetězec v chodu bez ztráty úloh.

Výběr AI modelu pro úsporu nákladů

Výběr AI modelu pro úsporu nákladů

Tři úrovně AI modelů — výkonný, rychlý a lehký — jsou dynamicky vybírány podle délky a složitosti obsahu, čímž přináší až 60% nižší náklady na API u kratšího obsahu.

Proces

Každý soubor — ať už syrová audio přednáška nebo celé video — prochází jedním automatizovaným řetězcem. Osm sekvenčních fází ho přemění ze syrového vstupu na výstup připravený k publikaci, přičemž zpracování videa běží paralelně, takže nic nečeká na nic.

Detekce a příprava médií

Detekce a příprava médií

FFprobe identifikuje, zda je soubor audio nebo video. U videa se zvuková stopa automaticky extrahuje. Analýza délky a formátu pak určuje strategii zpracování.

Dělení zvuku podle ticha

Dělení zvuku podle ticha

Soubory delší než 20 minut jsou rozděleny do úseků v přirozených tichých bodech, aby žádná fráze nebyla přerušena uprostřed věty, což umožňuje paralelní přepis všech částí současně.

AI přepisování

AI přepisování

Každý úsek je odeslán do Gemini Pro nebo Flash — vybraného podle délky obsahu — s ustrukturovaným schématem, které nutí model vrátit časově označený text s označením mluvčího.

Spojování časové osy

Spojování časové osy

Všechny přepsané části jsou spojeny s korektními časovými posuny do jednoho plynulého dokumentu s 99% přesným časovým sladěním v celém záznamu.

Post-processing textu

Post-processing textu

Syrový přepis prochází konverzí písma, aplikací diakritiky, čištěním formátu a ověřováním citací náboženských zdrojů vůči externí databázi.

Zpracování videa (paralelně)

Zpracování videa (paralelně)

Zatímco běží přepisování, video modul spravuje vícestupňové kódování HLS, generování miniatur, tvorbu náhledových klipů a správu vícestopého zvuku přes FFmpeg.

Generování titulků a shrnutí

Generování titulků a shrnutí

Z konečného ověřeného textu jsou generovány časované titulkové soubory (.vtt / .srt) spolu s automatickým metadatovým shrnutím pro knihovnu obsahu.

Doručení přes cloud

Doručení přes cloud

Vše — přepis, titulky, shrnutí, HLS streamy — je nahráno do AWS S3 s odkazy dodanými týmu pro obsah. 100% zachování dat i při výpadcích připojení.

Řešení

Klíčové vlastnosti řešení

  • Jednotný audio & video řetězec FFprobe automaticky rozpoznává formáty. Jediný vstupní bod zpracovává MP4, MKV, WebM, MOV a zvuk bez nutnosti ruční konverze.

  • Vícejazyčný AI přepis — Zpracovává záznamy v angličtině, aramejštině a smíšených jazycích s výzvami, které zachovávají jazykové hranice a aplikují správné konvence písma.

  • Dynamický výběr AI modelu — Úrovně Pro, Flash a Flash-Lite jsou automaticky vybírány podle délky souboru a typu obsahu — maximalizují přesnost a minimalizují náklady na API.

  • HLS streaming s více bitovými rychlostmi — Paralelní zpracování videa vytváří adaptivní streamy, náhledy a ukázky připravené pro jakýkoliv moderní video přehrávač.

  • 300+ současných dávkových úloh — Nativní Kubernetes asynchronní architektura zvládá velké dávky bez blokování. Helm charts řídí nasazení a škálování na ARM instancích.

Image

Výsledky v číslech

Přesnost přepisu

99%

Přesnost pro angličtinu a aramejský zvukový obsah s automatickou aplikací správného písma a diakritiky.

Současné úlohy

300+

Přepisové úlohy zpracovávány současně s inteligentním řízením fronty a adaptivním zpětným odkladem.

Nižší náklady na API

60%

Úspory díky dynamickému výběru modelu — lehčí modely automaticky zpracovávají kratší obsah.

Uchovávání dat

100%

Žádná ztráta dat ani během výpadků připojení, s automatickou synchronizací po obnovení spojení.

Máte na zpracování miliony minut? Postavme ten proces!

Řekněte nám své výzvy s obsahem nebo si rezervujte bezplatnou konzultaci - navrhneme řešení přizpůsobené vaší škále, jazykům a požadavkům na dodání.

Message not sent.
Message not sent.
×
Nejste si jistí, kde začít? Pomůžeme vám naplánovat další kroky!
×
Máte výzvu? Náš tým ji promění v řešení.
Souhlas se zpracováním osobních údajů