Vertex Transcribe Service
Overzicht van het geval
Een op AI aangedreven mediaverwerkingsplatform ontworpen om miljoenen minuten aan audio- en videocontent te verwerken. Het neemt opnames van educatieve lezingen — in het Aramees en Engels — en zet ze om in schone, geformatteerde tekst met correcte scripturen, diakritische tekens, geverifieerde verwijzingen en getimede ondertitels. Wanneer een videobestand binnenkomt, detecteert het systeem dit automatisch, extraheert de audiotrack en leidt het door dezelfde transcriptiepijplijn.
Doel: Een mediapijplijn bouwen die miljoenen minuten aan content kan verwerken en publicatieklare tekst, ondertitels en HLS-streams kan leveren - met zo min mogelijk handmatig werk. Zowel audio als video verwerken via een enkele pijplijn, meertalige content met hoge nauwkeurigheid transcriberen en dynamisch schalen op Kubernetes om batches van 300+ gelijktijdige opnames aan te kunnen.
Belangrijke projectinformatie
Sectoren
Platforms voor educatieve content, religieuze instellingen, mediapublicaties, e-learningbedrijven, lezingenarchieven, academische contentbibliotheken.
Diensten
AI-transcriptie, videobewerking, audio-extractie, HLS multi-bitrate codering, ondertitelgeneratie, batchorchestratie, verificatie van bronverwijzingen, cloudopslaglevering, miniatuur- en previewgeneratie.
Oplossingen
Geünificeerde audio-/videopijplijn, automatische formaatstdetectie, meertalige transcriptie, scriptconversie met diakritische tekens, stiltegebaseerde opsplitsing, tijdstempelsamenvoeging, verificatie van religieuze verwijzingen, dynamische AI-modelselectie.
Technologieën
Python, FastAPI, Google Vertex AI, Gemini Pro, Gemini Flash, Gemini Flash-Lite, FFmpeg, FFprobe, AWS S3, Google Cloud Storage, Kubernetes, Helm, Docker, ARM-instanties, HLS (m3u8), Async Python, Connection Pooling, CI/CD-pijplijn.
De uitdagingen
Het proces
Elk bestand — of het nu een ruwe audiolezing of een volledige videoregistratie is — doorloopt een enkele geautomatiseerde pijplijn. Acht opeenvolgende fases brengen het van ruwe input naar publicatieklare output, met videobewerking die parallel loopt zodat niets op iets anders hoeft te wachten.
Mediadetectie & voorbereiding
FFprobe identificeert of het bestand audio of video is. Voor video wordt de audiotrack automatisch geëxtraheerd. Duur- en formataanalyse bepalen vervolgens de verwerkingsstrategie.
Audio-opdeling op basis van stilte
Bestanden langer dan 20 minuten worden op natuurlijke stiltepuntjes in stukken gesplitst, zodat geen zin halverwege wordt afgebroken, wat gelijktijdige transcriptie over alle stukken mogelijk maakt.
AI-transcriptie
Elk stuk wordt verzonden naar Gemini Pro of Flash — geselecteerd op basis van inhoudslengte — met een gestructureerd schema dat het model dwingt getimede tekst met sprekerlabels terug te geven.
Tijdlijnsamenvoeging
Alle getranscribeerde stukken worden achteraf correct tijdgestempeld samengevoegd tot één naadloos document, met 99% nauwkeurige tijdstempelaanpassing over de volledige opname.
Tekstnabewerking
De ruwe transcriptie wordt geconverteerd naar script, krijgt diakritische tekens, opmaak wordt opgeschoond en religieuze bronvermeldingen worden geverifieerd via een externe database.
Videobewerking (parallel)
Terwijl de transcriptie loopt, verzorgt de videomodule HLS multi-bitrate codering, miniatuurgeneratie, previewclips en multi-audio-stream handling via FFmpeg.
Generatie van ondertitels & samenvattingen
Vanuit de definitieve geverifieerde tekst worden getimede ondertitelbestanden (.vtt / .srt) gegenereerd, samen met een automatische metadata-samenvatting voor de contentbibliotheek.
Cloudlevering
Alles — transcriptie, ondertitels, samenvatting, HLS-streams — wordt geüpload naar AWS S3 met links die aan het contentteam worden geleverd. 100% databehoud zelfs bij verbindingsuitval.
Oplossingen
De belangrijkste kenmerken van de oplossing
Geünificeerde audio- & videopijplijn — FFprobe detecteert formaten automatisch. Eén toegangsroute verwerkt MP4, MKV, WebM, MOV en audio zonder handmatige conversie.
Meertalige AI-transcriptie — Verwerkt opnames in het Engels, Aramees en gemengde talen met prompting die taalgrenzen bewaart en de juiste scriptconventies toepast.
Dynamische AI-modelselectie — Pro-, Flash- en Flash-Lite-niveaus worden automatisch gekozen op basis van bestandsduur en inhoudstype — met maximale nauwkeurigheid en minimale API-kosten.
HLS-multibitstreams — Parallelle videoprocessing produceert adaptieve bitrate-streams, miniaturen en previewclips die klaar zijn voor elke moderne videospeler.
300+ gelijktijdige batchtaken — Kubernetes-native asynchrone architectuur verwerkt grote batches zonder blokkering. Helm charts beheren uitrol en schaalvergroting op ARM-instanties.
Resultaten in cijfers
99%
Precisie voor Engels en Aramees audiocontent met automatisch toegepaste juiste schrijfwijze en diakritische tekens.
300+
Transcriptietaken die tegelijkertijd verwerkt worden met slimme wachtrijbeheer en adaptieve terugval.
60%
Besparen door dynamische modelselectie — lichtere modellen verwerken automatisch kortere inhoud.
100%
Geen verlies van gegevens, zelfs niet bij verbindingsonderbrekingen, met automatische synchronisatie zodra de verbinding is hersteld.