Careslate is een HIPAA-conforme AI-vertaalapp waarmee een arts en een patiënt die elkaars taal niet spreken elkaar toch realtime begrijpen, via live audio in twee richtingen en ondertiteling op het scherm. Geen account, geen login, geen betaalgegevens. Een zorgverlener opent de app, kiest twee talen, en het gesprek werkt gewoon, met medische bewoordingen die kloppen.

Echte gesprekken tussen zorgverleners en patiënten, realtime vertaald met medische terminologie die klopt. De interface blijft rustig en overzichtelijk, want de spreekkamer is al stressvol genoeg zonder verwarrende app, en alles wat de zorgverlener nodig heeft is één tik verwijderd.




Wij ontdekten al vroeg dat een directe aanpak van audio erin, tekst eruit niet betrouwbaar genoeg was voor medisch gebruik, dus bouwden wij een pipeline in drie stappen die de audio opschoont, de AI inperkt en de uitvoer controleert voordat er ook maar één vertaald woord de arts of de patiënt bereikt.
De microfoon van de telefoon vangt de spraak op, en voordat er iets bij de AI komt wordt de audio opgeschoond: ruis wordt onderdrukt, het volume genormaliseerd en de spraak opgeknipt op natuurlijke zinsgrenzen. Een drukke behandelkamer is nooit stil, dus juist het eerst opschonen van de audio maakt alles wat erna komt betrouwbaar.
De schone audio gaat naar de OpenAI Realtime API onder strikte promptbeperkingen. Het model transcribeert in de gesproken taal en vertaalt naar de doeltaal, en niets meer: geen toegevoegde context, geen verzonnen advies, alleen een getrouwe vertaling van wat er werkelijk is gezegd.
Voordat een vertaling wordt getoond, gaat die eerst door een validatielaag: lengteverhoudingen worden vergeleken en alles wat afwijkt wordt gemarkeerd. Vertalingen die de controle doorstaan, gaan via WebSocket binnen drie seconden rechtstreeks naar de chatinterface, zodat het gesprek een natuurlijk tempo houdt.
De arts spreekt Engels en de patiënt hoort Spaans; de patiënt antwoordt in het Spaans en de arts leest Engelse ondertiteling. Beide kanten werken live bij via WebSocket-verbindingen, zodat het aanvoelt als een echt gesprek heen en weer in plaats van een onhandige tool die om de beurt werkt.
Audio wordt op het moment zelf verwerkt en nooit als opname bewaard. Er blijven geen patiëntgegevens achter na de actieve sessie, en het geheel draait op HIPAA-geschikte AWS-diensten met versleuteling en auditlogging, zodat privacy in de architectuur zit in plaats van er achteraf op te worden beloofd.
Zorgvuldige prompt engineering zet de AI vast in een modus die uitsluitend vertaalt, en de validatielaag vergelijkt elke output met de verwachte vertaalverhoudingen en weigert alles wat medisch advies of context toevoegt die niet in de originele audio zat. In de geneeskunde is een verzonnen zin gevaarlijk, dus het systeem is zo gebouwd dat het er nooit een toevoegt.
Geen registratie, geen login, geen betaalgegevens. Een zorgprofessional opent de app, kiest twee talen en begint met vertalen. Onboarding zonder drempels was een kerneis, want niemand hoort een formulier in te vullen terwijl een patiënt wacht.
Careslate ondersteunt alle grote wereldtalen, met oog voor medische terminologie, en elk talenpaar wordt gecontroleerd op klinische nauwkeurigheid. Kiest u twee talen, dan blijft de sessie precies bij die twee, zonder dat een derde taal ertussen komt.
Vertaalde berichten verschijnen als gespreksbubbels die de originele transcriptie en de vertaling naast elkaar tonen. De chat bouwt zichzelf natuurlijk op terwijl het gesprek loopt, zonder pagina's te verversen en zonder handmatig op nieuwe berichten te controleren.
Rechtstreeks audio in, tekst uit oogde prima in een demo, maar viel in een echte kliniek uit elkaar. Dit liepen wij tegen het lijf, en zo losten wij het stuk voor stuk op.
Op zichzelf gaf de OpenAI Realtime API tijdens een live gesprek wisselende transcripties. Audio kwam in fragmenten binnen, medische termen werden verkeerd gelezen en antwoorden liepen achter op het natuurlijke spreektempo. Een rechttoe rechtaan aanpak van API naar uitvoer was simpelweg niet betrouwbaar genoeg voor een klinische omgeving.
Wij bouwden een eigen pipeline in drie stappen in plaats van te vertrouwen op directe output. Audio wordt opgenomen via de microfoon, gaat door een voorbewerkingsstap die hem opschoont en opdeelt en wordt daarna naar de API gestuurd voor transcriptie en vertaling. Door het in drie stappen te splitsen kregen wij bij elke stap grip op geluidskwaliteit, timing en foutherstel.
Hallucinatie was een serieus gevaar. Het model produceerde soms medisch advies dat niemand had uitgesproken, voegde context toe die er nooit was, of verzon terminologie. In de zorg kan één verkeerde vertaling echte schade veroorzaken, dus dit was geen risico dat wij aan het toeval konden overlaten.
Wij haalden hallucinaties eruit met strakke prompt engineering en validatie van de output. De systeemprompt beperkt het model tot alleen vertalen, met de uitdrukkelijke instructie nooit advies, context of terminologie toe te voegen die niet in de bronaudio zat, en een validatielaag markeert elk antwoord dat afwijkt van de verwachte vertaalverhoudingen.
De app moest strikt tussen de twee gekozen talen vertalen, zonder onderlinge storing. Koos een arts Engels naar Spaans, dan moest het systeem achtergrondspraak in andere talen negeren en de vertaalrichting nooit halverwege het gesprek omdraaien.
Wij losten de scheiding van taalparen op met promptontwerp en sessiearchitectuur. Elke sessie wordt op het moment van aanmaken aan precies twee talen gekoppeld, de prompt benoemt het toegestane paar expliciet, en audio die niet overeenkomt met de brontaal wordt eruit gefilterd voordat die de AI bereikt.
Vertaalde audio omzetten in een soepel gesprek vroeg om zorgvuldige orkestratie. De gebruiker spreekt, de audio wordt opgenomen, de AI transcribeert en vertaalt, en het resultaat moet als leesbare chat verschijnen, allemaal binnen enkele seconden en zonder dat de interface vastloopt.
Wij koppelden de pipeline aan de frontend via WebSocket-kanalen. Zodra een vertaald segment klaar is, gaat het meteen naar de client en toont de chat het als een tekstballon met het origineel en de vertaling naast elkaar, zodat het gesprek zich bericht voor bericht opbouwt zonder verversen of pollen.
SwiftUI draait de native iOS-app, terwijl AVFoundation de audio-opname verzorgt. De OpenAI Realtime API levert transcriptie en vertaling via onze eigen pipeline in drie stappen, en WebSocket bezorgt de vertaalde berichten realtime. De hele flow is HIPAA-conform, waarbij op geen enkel moment patiëntgegevens worden opgeslagen.
// Careslate — 3-way audio pipeline { "app": "SwiftUI + AVFoundation", "ai": "OpenAI Realtime API", "realtime": "WebSocket", "pipeline": "3-Way (capture → clean → translate)", "hipaa_compliant": true, "hallucination_guard": true, "data_storage": false }
Careslate was anders, omdat de inzet medisch was. Een verkeerde vertaling is hier niet alleen vervelend, maar gevaarlijk. De OpenAI Realtime API is krachtig, maar niet zonder meer productieklaar voor medisch gebruik.
De directe aanpak werkte in een demo en liep vervolgens vast op achtergrondgeluid, accenten en medisch jargon; onze pipeline in drie stappen loste elk probleem op dat de directe versie had.
Dat hangt af van de scope, maar als richtlijn kost een gerichte HIPAA-conforme medische vertaalapp als Careslate doorgaans tussen EUR 25,000 en EUR 50,000 of meer, afhankelijk van de talen, de integraties en de diepte van de compliance. Wij geven een vaste inschatting na een korte kennismaking, in plaats van blind te offreren.
Dat kan, als de app daarop is gebouwd. Nauwkeurigheid komt van meer dan het model: in Careslate komt die van het eerst schoonmaken van de audio, het vastzetten van de AI op uitsluitend vertalen, en het valideren van elke uitvoer voordat die wordt getoond. Die combinatie maakt de app betrouwbaar in een echte spreekkamer en niet alleen in een demo.
Door privacy vanaf het begin mee te ontwerpen. In Careslate wordt audio live verwerkt en nooit als opname bewaard, blijft er na de sessie geen patiëntinformatie achter, en draait alles op HIPAA-geschikte infrastructuur met versleuteling en auditlogging. Compliance zit in de architectuur en wordt er niet aan het eind aan toegevoegd.
Dat is de aanpak die wij hebben gebouwd, omdat audio erin en tekst eruit niet betrouwbaar genoeg was. Stap één neemt de audio op en maakt die schoon, stap twee transcribeert en vertaalt onder strakke beperkingen, en stap drie valideert het resultaat voordat het wordt geleverd. Door het zo op te splitsen houdt u bij elke stap grip op kwaliteit, timing en foutherstel.
U kunt het het beste zien als snelle, altijd beschikbare ondersteuning en niet als volledige vervanging van een professionele tolk in complexe of risicovolle situaties. Voor de vele alledaagse momenten waarop een zorgverlener en een patiënt elkaar simpelweg niet begrijpen en er geen tolk beschikbaar is, overbrugt een tool als Careslate dat gat veilig en direct.
Via strikte prompt engineering en validatie van de uitvoer. De system prompt zet het model vast op alleen vertalen en verbiedt het toevoegen van advies, context of terminologie die niet is uitgesproken, en een validatielaag weigert elke uitvoer die afwijkt van de verwachte vertaalverhoudingen. Het doel is een getrouwe vertaling, zonder dat er iets wordt verzonnen.
Careslate ondersteunt meer dan tien grote wereldtalen met kennis van medische terminologie, en elk talenpaar is gecontroleerd op klinische nauwkeurigheid. Elke sessie is vergrendeld op precies twee gekozen talen, zodat een derde taal in de ruimte niet stoort.
Careslate kostte ongeveer drie maanden, van concept tot een werkende HIPAA-conforme app. De doorlooptijd hangt af van het aantal talen, de compliance-eisen en de diepte van de pipeline. Wij werken in sprints van twee weken, zodat de voortgang steeds zichtbaar is in plaats van dat het stil blijft tot de lancering.
Wij bouwen HIPAA-conforme mobiele apps met realtime AI-functies. Van medische vertaling tot klinische workflows: wij hebben het opgeleverd.