Vertex Transcribe Service

Case overzicht

Een AI-gestuurd mediaverwerkingsplatform ontworpen om miljoenen minuten audio- en videocontent aan te kunnen. Het verwerkt opnames van educatieve lezingen — in Aramees en Engels — en zet ze om in schone, geformatteerde tekst met correcte schrifttekens, diakritische tekens, geverifieerde verwijzingen en getimede ondertitels. Wanneer een videobestand binnenkomt, detecteert het systeem dit automatisch, extraheert de audiotrack en leidt het door dezelfde transcriptie-pijplijn.

Doel: Bouw een mediapijplijn die miljoenen minuten inhoud kan verwerken en publicatieklaar tekst, ondertitels en HLS-streams levert - met zo min mogelijk handmatig werk. Verwerk zowel audio als video via één enkele pijplijn, transcribeer meertalige inhoud met hoge nauwkeurigheid, en schaal dynamisch op Kubernetes om batches van 300+ gelijktijdige opnames aan te kunnen.

Image

Belangrijke projectinformatie

Industrieën

Industrieën

Platforms voor educatieve inhoud, religieuze instellingen, mediapublicaties, e-learningbedrijven, lezingenarchieven, academische inhoudsbibliotheken.

Diensten

Diensten

AI-transcriptie, videobewerking, audio-extractie, HLS-multibitrate-encoding, ondertitelgeneratie, batchorkestratie, bronverificatie, cloudopslaglevering, miniatuur- en previewgeneratie.

Oplossingen

Oplossingen

Geïntegreerde audio/video-pijplijn, automatische formaatdetectie, meertalige transcriptie, scriptconversie met diakritische tekens, chunking op stiltebasis, tijdstempel-samenvoeging, verificatie van religieuze verwijzingen, dynamische AI-modelselectie.

Technologieën

Technologieën

Python, FastAPI, Google Vertex AI, Gemini Pro, Gemini Flash, Gemini Flash-Lite, FFmpeg, FFprobe, AWS S3, Google Cloud Storage, Kubernetes, Helm, Docker, ARM-instanties, HLS (m3u8), Asynchroon Python, Connection Pooling, CI/CD-pijplijn.

De uitdagingen

Gemengde taalcomplexiteit

Gemengde taalcomplexiteit

Audio wisselt tijdens de opname tussen Aramees, Engels en andere talen. Speciale AI-aansturing en meerstaps tekstverwerking waren nodig om overal correcte diakritische tekens en opmaak toe te passen.

Video & audio in één pijplijn

Video & audio in één pijplijn

Het systeem moest zowel pure audio als videobestanden verwerken. FFprobe-gebaseerde autodetectie extraheert de audiostream uit elk videoformaat voordat het wordt verwerkt — geen gebruikersinterventie vereist.

Schaalbaar tot miljoenen minuten

Schaalbaar tot miljoenen minuten

Ontworpen vanaf de basis voor enorme volumes: volledig asynchroon, parallel en Kubernetes-native met goed resourcebeheer om pieken in batchbelastingen op te vangen.

Slimme opsplitsing voor lange hoorcolleges

Slimme opsplitsing voor lange hoorcolleges

Colleges duren vaak langer dan een uur. Stiltedetectie splitst bestanden natuurlijk in delen, terwijl tijdstempels samenvoegen een naadloze continue tijdlijn zonder gaten of overlappen herstelt.

Slim retry-systeem voor AI-workloads

Slim retry-systeem voor AI-workloads

Honderden gelijktijdige AI-taken drukken de grenzen van de provider hard. Slimme retry-logica, adaptieve exponentiële backoff en wachtrijbeheer houden de pijplijn draaiende zonder verloren taken.

AI-modelselectie voor kostenefficiëntie

AI-modelselectie voor kostenefficiëntie

Drie AI-modellen — krachtig, snel en lichtgewicht — worden dynamisch geselecteerd op basis van de lengte en complexiteit van de inhoud, wat tot 60% lagere API-kosten oplevert bij kortere content.

Het proces

Elk bestand — of het nu een ruwe audiocollege of een volledige video-opname is — gaat door één geautomatiseerde pijplijn. Acht opeenvolgende fasen brengen het van ruwe invoer naar publicatieklaar resultaat, waarbij videobewerking parallel loopt zodat niets hoeft te wachten.

Mediadetectie & voorbereiding

Mediadetectie & voorbereiding

FFprobe identificeert of het bestand audio of video is. Voor video wordt de audiotrack automatisch geëxtraheerd. Duur- en formataanalyse bepalen vervolgens de verwerkingsstrategie.

Audio opsplitsing op basis van stilte

Audio opsplitsing op basis van stilte

Bestanden langer dan 20 minuten worden op natuurlijke stiltepunten in stukken gesplitst zodat geen zin halverwege wordt afgebroken, wat gelijktijdige transcriptie van alle stukken mogelijk maakt.

AI-transcriptie

AI-transcriptie

Elk stuk wordt gestuurd naar Gemini Pro of Flash — geselecteerd op basis van inhoudslengte — met een gestructureerd schema dat het model dwingt getimeerde tekst met sprekerlabels terug te geven.

Tijdlijn samenvoegen

Tijdlijn samenvoegen

Alle getranscribeerde stukken worden met correcte tijdverschuivingen aan elkaar gezet tot één naadloos document, met 99% accurate tijdstempels over de gehele opname.

Tekst naverwerking

Tekst naverwerking

Ruwe transcriptie gaat door scriptconversie, toepassen van diakritische tekens, opschoning van formatting en verificatie van religieuze bronvermelding tegen een externe database.

Videobewerking (parallel)

Videobewerking (parallel)

Terwijl de transcriptie loopt, verwerkt de videomodule HLS-multibitrate-encoding, miniatuurgeneratie, previewclips en afhandeling van meerdere audiostreams via FFmpeg.

Generatie van ondertitels & samenvattingen

Generatie van ondertitels & samenvattingen

Vanuit de definitieve geverifieerde tekst worden getimede ondertitelbestanden (.vtt / .srt) gegenereerd, naast een automatische metadata-samenvatting voor de contentbibliotheek.

Cloud-levering

Cloud-levering

Alles — transcriptie, ondertitels, samenvatting, HLS-streams — wordt geüpload naar AWS S3 met links die aan het contentteam worden geleverd. 100% gegevensbehoud, ook bij verbindingsverlies.

Oplossingen

De belangrijkste kenmerken van de oplossing

  • Geïntegreerde Audio- & Video-pijplijn FFprobe detecteert automatisch formaten. Een enkel ingangspunt verwerkt MP4, MKV, WebM, MOV en audio zonder handmatige conversie.

  • Meertalige AI-transcriptie — Ondersteunt Engelse, Aramese en meertalige opnames met aanwijzingen die taalgrenzen behouden en de juiste schrijfconventies toepassen.

  • Dynamische AI-modelselectie — Pro-, Flash- en Flash-Lite-niveaus worden automatisch gekozen op basis van bestandslengte en inhoudstype — maximaal nauwkeurig met minimale API-kosten.

  • HLS multi-bitrate streaming — Parallelle videobewerking produceert adaptieve bitrate-streams, miniaturen en previewclips die klaar zijn voor elke moderne videospeler.

  • 300+ gelijktijdige batchtaken — Kubernetes-native asynchrone architectuur verwerkt grote batches zonder blokkering. Helm-charts beheren implementatie en schaalvergroting op ARM-instanties.

Image

Resultaten in cijfers

Transcriptienauwkeurigheid

99%

Precisie voor Engelse en Aramese audio-inhoud met automatisch toegevoegde correcte schrijfwijze en diakritische tekens.

Gelijktijdige taken

300+

Transcriptietaken tegelijkertijd verwerkt met slimme wachtrijbeheer en adaptieve backoff.

Lagere API-kosten

60%

Besparingen door dynamische modelselectie — lichtere modellen verwerken automatisch kortere inhoud.

Gegevensbewaring

100%

Geen gegevensverlies, zelfs niet bij verbindingsonderbrekingen, met automatische synchronisatie zodra de verbinding is hersteld.

Heb je miljoenen minuten om te verwerken? Laten we de pijplijn bouwen!

Vertel ons je contentuitdaging of boek een gratis consult - we schetsen een oplossing op maat van je schaal, talen en leveringsvereisten.

Message not sent.
Message not sent.
×
Weet u niet waar u moet beginnen? We helpen u de volgende stappen uit te stippelen!
Toestemming voor de verwerking van persoonsgegevens
×
Een uitdaging? Ons team maakt er een oplossing van.
Toestemming voor de verwerking van persoonsgegevens