Služba přepisu Vertex

Přehled případu

Mediální platforma založená na umělé inteligenci navržená pro zpracování milionů minut audio a video obsahu. Zpracovává nahrávky vzdělávacích přednášek – v aramejštině a angličtině – a převádí je na čistý, formátovaný text se správným skriptem, diakritikou, ověřenými odkazy a časovými titulky. Když přijde video soubor, systém jej automaticky detekuje, extrahuje zvukovou stopu a směruje ji přes stejnou transkripční pipeline.

Cíl: Vytvořit mediální pipeline schopnou zpracovávat miliony minut obsahu a dodávat text připravený k publikaci, titulky a HLS streamy - s co nejmenší manuální prací. Zpracovávat jak zvuk, tak video přes jedinou pipeline, přepisovat vícejazyčný obsah s vysokou přesností a dynamicky škálovat na Kubernetes pro zvládnutí dávek s více než 300 souběžnými nahrávkami.

Image

Klíčové informace o projektu

Odvětví

Odvětví

Platformy vzdělávacího obsahu, náboženské instituce, mediální vydavatelství, společnosti e-learningu, archivy přednášek, akademické knihovny.

Služby

Služby

Přepis pomocí AI, zpracování videa, extrakce zvuku, HLS kódování s více bitrate, generování titulků, orchestrace dávek, ověřování zdrojových odkazů, doručování cloudového úložiště, generování náhledů a miniatur.

Řešení

Řešení

Jednotná audio/video pipeline, automatická detekce formátu, vícejazyčný přepis, konverze skriptu s diakritikou, dělení na části podle ticha, spojování časových značek, ověřování náboženských odkazů, dynamický výběr AI modelů.

Technologie

Technologie

Python, FastAPI, Google Vertex AI, Gemini Pro, Gemini Flash, Gemini Flash-Lite, FFmpeg, FFprobe, AWS S3, Google Cloud Storage, Kubernetes, Helm, Docker, ARM instance, HLS (m3u8), Async Python, Connection Pooling, CI/CD pipeline.

Výzvy

Komplexnost vícejazyčného obsahu

Komplexnost vícejazyčného obsahu

Zvuk přechází během nahrávání mezi aramejštinou, angličtinou a dalšími jazyky. Bylo potřeba speciální AI vyvolání a vícestupňové zpracování textu, aby se správně aplikovala diakritika a formátování.

Video a audio v jedné pipeline

Video a audio v jedné pipeline

Systém musel zvládnout jak čistý zvuk, tak video kontejnery. Automatická detekce založená na FFprobe extrahuje zvukovou stopu z libovolného video formátu před zpracováním – bez nutnosti zásahu uživatele.

Škálování na miliony minut

Škálování na miliony minut

Navrženo od základu pro masivní objem: plně asynchronní, paralelizované a Kubernetes-native se správou zdrojů, která dokáže absorbovat náhlé nárůsty dávek.

Chytré dělení pro dlouhé přednášky

Chytré dělení pro dlouhé přednášky

Přednášky často přesahují jednu hodinu. Dělení podle detekce ticha soubory přirozeně rozděluje, zatímco spojování časových značek rekonstruuje plynulou kontinuální časovou osu bez mezer nebo překryvů.

Inteligentní systém opakování pro AI úlohy

Inteligentní systém opakování pro AI úlohy

Stovky souběžných AI úloh tlačí limity poskytovatele. Inteligentní logika opakování, adaptivní exponenciální zálohování a správa front umožňují pipeline pokračovat bez ztráty žádných úloh.

Výběr AI modelu pro efektivitu nákladů

Výběr AI modelu pro efektivitu nákladů

Tři úrovně AI modelů – výkonný, rychlý a lehký – jsou dynamicky vybírány podle délky a složitosti obsahu, čímž poskytují až o 60 % nižší náklady na API u kratšího obsahu.

Proces

Každý soubor – ať už surová audio přednáška nebo plná video nahrávka – prochází jedinou automatizovanou pipeline. Osm po sobě jdoucích fází vede od surového vstupu až po výstup připravený k publikaci, přičemž zpracování videa běží paralelně, takže nic nečeká na nic jiného.

Detekce a příprava médií

Detekce a příprava médií

FFprobe určuje, zda je soubor audio nebo video. U videa se automaticky extrahuje zvuková stopa. Analýza délky a formátu pak určuje strategii zpracování.

Dělení zvuku podle ticha

Dělení zvuku podle ticha

Soubory delší než 20 minut se dělí na části na přirozených místech ticha, aby žádná fráze nebyla přerušena uprostřed věty, což umožňuje paralelní přepis všech částí zároveň.

Přepis pomocí AI

Přepis pomocí AI

Každá část je poslána do Gemini Pro nebo Flash – vybrané podle délky obsahu – se strukturovaným schématem, které nutí model vracet časově označený text s popisky mluvčích.

Spojování časové osy

Spojování časové osy

Všechny přepsané části jsou zpět spojeny s korektními časovými posuny do jednoho plynulého dokumentu s 99% přesností zarovnání časových značek v celé nahrávce.

Post-processing textu

Post-processing textu

Surový přepis prochází konverzí skriptu, aplikací diakritiky, čištěním formátování a ověřováním náboženských citací vůči externí databázi.

Zpracování videa (paralelně)

Zpracování videa (paralelně)

Zatímco probíhá přepis, video modul zajišťuje HLS kódování s více bitrate, generování náhledů, tvorbu ukázkových klipů a zpracování více zvukových stop přes FFmpeg.

Generování titulků a shrnutí

Generování titulků a shrnutí

Z konečného ověřeného textu jsou generovány časové soubory titulků (.vtt / .srt) spolu s automatickým metadatovým shrnutím pro knihovnu obsahu.

Cloudové doručení

Cloudové doručení

Vše – přepis, titulky, shrnutí, HLS streamy – se nahraje do AWS S3 a odkazy jsou doručeny týmu zabývajícímu se obsahem. 100% uchování dat i při výpadcích připojení.

Řešení

Klíčové vlastnosti řešení

  • Jednotný audio a video kanál FFprobe automaticky detekuje formáty. Jeden vstupní bod zpracovává MP4, MKV, WebM, MOV a audio bez nutnosti manuální konverze.

  • Vícejazyčný AI přepis — Zpracovává záznamy v angličtině, aramejštině a ve smíšených jazycích s výzvami, které zachovávají jazykové hranice a aplikují správné konvence písem.

  • Dynamický výběr AI modelu — Profesionální, Flash a Flash-Lite úrovně jsou vybírány automaticky podle délky souboru a typu obsahu — maximalizují přesnost při minimalizaci nákladů na API.

  • HLS streamování s více bitovými rychlostmi — Paralelní zpracování videa vytváří adaptivní streamy, náhledové miniatury a ukázkové klipy připravené pro jakýkoli moderní video přehrávač.

  • 300+ současných dávkových úloh — Kubernetes-native asynchronní architektura zvládá velké dávky bez zablokování. Helm grafy spravují nasazení a škálování na ARM instancích.

Image

Výsledky v číslech

Přesnost přepisu

99%

Přesnost pro audio obsah v angličtině a aramejštině s automatickou aplikací správného písma a diakritiky.

Současné úlohy

300+

Úlohy přepisu zpracovávány současně s inteligentním řízením fronty a adaptivním zpomalováním.

Nižší náklady na API

60%

Úspory díky dynamickému výběru modelu — lehčí modely automaticky zpracovávají kratší obsah.

Uchování dat

100%

Žádná ztráta dat ani při výpadcích připojení, s automatickou synchronizací po obnovení spojení.

Máte miliony minut ke zpracování? Pojďme postavit kanál!

Řekněte nám o svém problému s obsahem nebo si rezervujte bezplatnou konzultaci – navrhneme řešení přizpůsobené vašemu rozsahu, jazykům a požadavkům na dodání.

Message not sent.
Message not sent.
×
Nejste si jistí, kde začít? Pomůžeme vám naplánovat další kroky!
×
Máte výzvu? Náš tým ji promění v řešení.
Souhlas se zpracováním osobních údajů