Vertex Transcribe Service

Overzicht van het geval

Een op AI aangedreven mediaverwerkingsplatform ontworpen om miljoenen minuten aan audio- en videocontent te verwerken. Het neemt opnames van educatieve lezingen — in het Aramees en Engels — en zet ze om in schone, geformatteerde tekst met correcte scripturen, diakritische tekens, geverifieerde verwijzingen en getimede ondertitels. Wanneer een videobestand binnenkomt, detecteert het systeem dit automatisch, extraheert de audiotrack en leidt het door dezelfde transcriptiepijplijn.

Doel: Een mediapijplijn bouwen die miljoenen minuten aan content kan verwerken en publicatieklare tekst, ondertitels en HLS-streams kan leveren - met zo min mogelijk handmatig werk. Zowel audio als video verwerken via een enkele pijplijn, meertalige content met hoge nauwkeurigheid transcriberen en dynamisch schalen op Kubernetes om batches van 300+ gelijktijdige opnames aan te kunnen.

Image

Belangrijke projectinformatie

Sectoren

Sectoren

Platforms voor educatieve content, religieuze instellingen, mediapublicaties, e-learningbedrijven, lezingenarchieven, academische contentbibliotheken.

Diensten

Diensten

AI-transcriptie, videobewerking, audio-extractie, HLS multi-bitrate codering, ondertitelgeneratie, batchorchestratie, verificatie van bronverwijzingen, cloudopslaglevering, miniatuur- en previewgeneratie.

Oplossingen

Oplossingen

Geünificeerde audio-/videopijplijn, automatische formaatstdetectie, meertalige transcriptie, scriptconversie met diakritische tekens, stiltegebaseerde opsplitsing, tijdstempelsamenvoeging, verificatie van religieuze verwijzingen, dynamische AI-modelselectie.

Technologieën

Technologieën

Python, FastAPI, Google Vertex AI, Gemini Pro, Gemini Flash, Gemini Flash-Lite, FFmpeg, FFprobe, AWS S3, Google Cloud Storage, Kubernetes, Helm, Docker, ARM-instanties, HLS (m3u8), Async Python, Connection Pooling, CI/CD-pijplijn.

De uitdagingen

Complexiteit van gemengde talen

Complexiteit van gemengde talen

Audio schakelt halverwege de opname tussen Aramees, Engels en andere talen. Speciale AI-aansturing en meervoudige tekstreeksverwerking waren nodig om correcte diakritische tekens en opmaak toe te passen.

Video & audio in één pijplijn

Video & audio in één pijplijn

Het systeem moest zowel pure audio- als videocontainers aankunnen. FFprobe-gebaseerde autodetectie extraheert de audiostream uit elk videoformaat vóór verwerking — zonder gebruikersinterventie.

Schaal voor miljoenen minuten

Schaal voor miljoenen minuten

Vanuit de grond af ontworpen voor enorme volumes: volledig asynchroon, parallel en Kubernetes-native met juiste resourcebeheer om pieken in batchbelasting op te vangen.

Slimme opsplitsing voor lange lezingaudio

Slimme opsplitsing voor lange lezingaudio

Lezingen duren vaak langer dan een uur. Stilte-detectie splits bestanden natuurlijk, terwijl tijdstempelsamenvoeging een naadloze doorlopende tijdlijn reconstrueert zonder hiaten of overlappingen.

Slim herstelmechanisme voor AI-werkbelastingen

Slim herstelmechanisme voor AI-werkbelastingen

Honderden gelijktijdige AI-taken drukken zwaar op providerlimieten. Slimme retry-logica, adaptieve exponentiële backoff en wachtrijbeheer houden de pijplijn draaiende zonder verloren taken.

AI-modelselectie voor kostenefficiëntie

AI-modelselectie voor kostenefficiëntie

Drie AI-modelniveaus - krachtig, snel en lichtgewicht - worden dynamisch geselecteerd op basis van inhoudslengte en complexiteit en leveren tot 60% lagere API-kosten bij kortere content.

Het proces

Elk bestand — of het nu een ruwe audiolezing of een volledige videoregistratie is — doorloopt een enkele geautomatiseerde pijplijn. Acht opeenvolgende fases brengen het van ruwe input naar publicatieklare output, met videobewerking die parallel loopt zodat niets op iets anders hoeft te wachten.

Mediadetectie & voorbereiding

Mediadetectie & voorbereiding

FFprobe identificeert of het bestand audio of video is. Voor video wordt de audiotrack automatisch geëxtraheerd. Duur- en formataanalyse bepalen vervolgens de verwerkingsstrategie.

Audio-opdeling op basis van stilte

Audio-opdeling op basis van stilte

Bestanden langer dan 20 minuten worden op natuurlijke stiltepuntjes in stukken gesplitst, zodat geen zin halverwege wordt afgebroken, wat gelijktijdige transcriptie over alle stukken mogelijk maakt.

AI-transcriptie

AI-transcriptie

Elk stuk wordt verzonden naar Gemini Pro of Flash — geselecteerd op basis van inhoudslengte — met een gestructureerd schema dat het model dwingt getimede tekst met sprekerlabels terug te geven.

Tijdlijnsamenvoeging

Tijdlijnsamenvoeging

Alle getranscribeerde stukken worden achteraf correct tijdgestempeld samengevoegd tot één naadloos document, met 99% nauwkeurige tijdstempelaanpassing over de volledige opname.

Tekstnabewerking

Tekstnabewerking

De ruwe transcriptie wordt geconverteerd naar script, krijgt diakritische tekens, opmaak wordt opgeschoond en religieuze bronvermeldingen worden geverifieerd via een externe database.

Videobewerking (parallel)

Videobewerking (parallel)

Terwijl de transcriptie loopt, verzorgt de videomodule HLS multi-bitrate codering, miniatuurgeneratie, previewclips en multi-audio-stream handling via FFmpeg.

Generatie van ondertitels & samenvattingen

Generatie van ondertitels & samenvattingen

Vanuit de definitieve geverifieerde tekst worden getimede ondertitelbestanden (.vtt / .srt) gegenereerd, samen met een automatische metadata-samenvatting voor de contentbibliotheek.

Cloudlevering

Cloudlevering

Alles — transcriptie, ondertitels, samenvatting, HLS-streams — wordt geüpload naar AWS S3 met links die aan het contentteam worden geleverd. 100% databehoud zelfs bij verbindingsuitval.

Oplossingen

De belangrijkste kenmerken van de oplossing

  • Geünificeerde audio- & videopijplijn FFprobe detecteert formaten automatisch. Eén toegangsroute verwerkt MP4, MKV, WebM, MOV en audio zonder handmatige conversie.

  • Meertalige AI-transcriptie — Verwerkt opnames in het Engels, Aramees en gemengde talen met prompting die taalgrenzen bewaart en de juiste scriptconventies toepast.

  • Dynamische AI-modelselectie — Pro-, Flash- en Flash-Lite-niveaus worden automatisch gekozen op basis van bestandsduur en inhoudstype — met maximale nauwkeurigheid en minimale API-kosten.

  • HLS-multibitstreams — Parallelle videoprocessing produceert adaptieve bitrate-streams, miniaturen en previewclips die klaar zijn voor elke moderne videospeler.

  • 300+ gelijktijdige batchtaken — Kubernetes-native asynchrone architectuur verwerkt grote batches zonder blokkering. Helm charts beheren uitrol en schaalvergroting op ARM-instanties.

Image

Resultaten in cijfers

Transcriptienauwkeurigheid

99%

Precisie voor Engels en Aramees audiocontent met automatisch toegepaste juiste schrijfwijze en diakritische tekens.

Gelijktijdige taken

300+

Transcriptietaken die tegelijkertijd verwerkt worden met slimme wachtrijbeheer en adaptieve terugval.

Lagere API-kosten

60%

Besparen door dynamische modelselectie — lichtere modellen verwerken automatisch kortere inhoud.

Gegevensbehoud

100%

Geen verlies van gegevens, zelfs niet bij verbindingsonderbrekingen, met automatische synchronisatie zodra de verbinding is hersteld.

Miljoenen minuten te verwerken? Laten we de pijplijn ontwerpen!

Vertel ons uw contentuitdaging of boek een gratis consult — wij schetsen een oplossing op maat van uw schaal, talen en leveringsvereisten.

Message not sent.
Message not sent.
×
Weet u niet waar u moet beginnen? We helpen u de volgende stappen uit te stippelen!
Toestemming voor de verwerking van persoonsgegevens
×
Een uitdaging? Ons team maakt er een oplossing van.
Toestemming voor de verwerking van persoonsgegevens