Vertex Transcribe Service
Case overzicht
Een AI-gestuurd mediaverwerkingsplatform ontworpen om miljoenen minuten audio- en videocontent aan te kunnen. Het verwerkt opnames van educatieve lezingen — in Aramees en Engels — en zet ze om in schone, geformatteerde tekst met correcte schrifttekens, diakritische tekens, geverifieerde verwijzingen en getimede ondertitels. Wanneer een videobestand binnenkomt, detecteert het systeem dit automatisch, extraheert de audiotrack en leidt het door dezelfde transcriptie-pijplijn.
Doel: Bouw een mediapijplijn die miljoenen minuten inhoud kan verwerken en publicatieklaar tekst, ondertitels en HLS-streams levert - met zo min mogelijk handmatig werk. Verwerk zowel audio als video via één enkele pijplijn, transcribeer meertalige inhoud met hoge nauwkeurigheid, en schaal dynamisch op Kubernetes om batches van 300+ gelijktijdige opnames aan te kunnen.
Belangrijke projectinformatie
Industrieën
Platforms voor educatieve inhoud, religieuze instellingen, mediapublicaties, e-learningbedrijven, lezingenarchieven, academische inhoudsbibliotheken.
Diensten
AI-transcriptie, videobewerking, audio-extractie, HLS-multibitrate-encoding, ondertitelgeneratie, batchorkestratie, bronverificatie, cloudopslaglevering, miniatuur- en previewgeneratie.
Oplossingen
Geïntegreerde audio/video-pijplijn, automatische formaatdetectie, meertalige transcriptie, scriptconversie met diakritische tekens, chunking op stiltebasis, tijdstempel-samenvoeging, verificatie van religieuze verwijzingen, dynamische AI-modelselectie.
Technologieën
Python, FastAPI, Google Vertex AI, Gemini Pro, Gemini Flash, Gemini Flash-Lite, FFmpeg, FFprobe, AWS S3, Google Cloud Storage, Kubernetes, Helm, Docker, ARM-instanties, HLS (m3u8), Asynchroon Python, Connection Pooling, CI/CD-pijplijn.
De uitdagingen
Het proces
Elk bestand — of het nu een ruwe audiocollege of een volledige video-opname is — gaat door één geautomatiseerde pijplijn. Acht opeenvolgende fasen brengen het van ruwe invoer naar publicatieklaar resultaat, waarbij videobewerking parallel loopt zodat niets hoeft te wachten.
Mediadetectie & voorbereiding
FFprobe identificeert of het bestand audio of video is. Voor video wordt de audiotrack automatisch geëxtraheerd. Duur- en formataanalyse bepalen vervolgens de verwerkingsstrategie.
Audio opsplitsing op basis van stilte
Bestanden langer dan 20 minuten worden op natuurlijke stiltepunten in stukken gesplitst zodat geen zin halverwege wordt afgebroken, wat gelijktijdige transcriptie van alle stukken mogelijk maakt.
AI-transcriptie
Elk stuk wordt gestuurd naar Gemini Pro of Flash — geselecteerd op basis van inhoudslengte — met een gestructureerd schema dat het model dwingt getimeerde tekst met sprekerlabels terug te geven.
Tijdlijn samenvoegen
Alle getranscribeerde stukken worden met correcte tijdverschuivingen aan elkaar gezet tot één naadloos document, met 99% accurate tijdstempels over de gehele opname.
Tekst naverwerking
Ruwe transcriptie gaat door scriptconversie, toepassen van diakritische tekens, opschoning van formatting en verificatie van religieuze bronvermelding tegen een externe database.
Videobewerking (parallel)
Terwijl de transcriptie loopt, verwerkt de videomodule HLS-multibitrate-encoding, miniatuurgeneratie, previewclips en afhandeling van meerdere audiostreams via FFmpeg.
Generatie van ondertitels & samenvattingen
Vanuit de definitieve geverifieerde tekst worden getimede ondertitelbestanden (.vtt / .srt) gegenereerd, naast een automatische metadata-samenvatting voor de contentbibliotheek.
Cloud-levering
Alles — transcriptie, ondertitels, samenvatting, HLS-streams — wordt geüpload naar AWS S3 met links die aan het contentteam worden geleverd. 100% gegevensbehoud, ook bij verbindingsverlies.
Oplossingen
De belangrijkste kenmerken van de oplossing
Geïntegreerde Audio- & Video-pijplijn — FFprobe detecteert automatisch formaten. Een enkel ingangspunt verwerkt MP4, MKV, WebM, MOV en audio zonder handmatige conversie.
Meertalige AI-transcriptie — Ondersteunt Engelse, Aramese en meertalige opnames met aanwijzingen die taalgrenzen behouden en de juiste schrijfconventies toepassen.
Dynamische AI-modelselectie — Pro-, Flash- en Flash-Lite-niveaus worden automatisch gekozen op basis van bestandslengte en inhoudstype — maximaal nauwkeurig met minimale API-kosten.
HLS multi-bitrate streaming — Parallelle videobewerking produceert adaptieve bitrate-streams, miniaturen en previewclips die klaar zijn voor elke moderne videospeler.
300+ gelijktijdige batchtaken — Kubernetes-native asynchrone architectuur verwerkt grote batches zonder blokkering. Helm-charts beheren implementatie en schaalvergroting op ARM-instanties.
Resultaten in cijfers
99%
Precisie voor Engelse en Aramese audio-inhoud met automatisch toegevoegde correcte schrijfwijze en diakritische tekens.
300+
Transcriptietaken tegelijkertijd verwerkt met slimme wachtrijbeheer en adaptieve backoff.
60%
Besparingen door dynamische modelselectie — lichtere modellen verwerken automatisch kortere inhoud.
100%
Geen gegevensverlies, zelfs niet bij verbindingsonderbrekingen, met automatische synchronisatie zodra de verbinding is hersteld.