Sluiten

Google vertaalt Amerikaanse gebarentaal live naar tekst

Google DeepMind brengt een AI-model voor gebarentaal naar Gboard en Live Transcribe op de Pixel 11. Dove en slechthorende gebruikers kunnen Amerikaanse Gebarentaal voor de camera gebruiken en de Engelse vertaling vervolgens invoeren waar zij anders tekst zouden typen.

Dat is een belangrijke stap voor digitale toegankelijkheid, maar nog geen automatische tolk voor het onderwijs. De eerste versie werkt alleen van American Sign Language (ASL) naar Engels, is niet getest met minderjarigen en is volgens Google en betrokken organisaties uit de Dovengemeenschap niet bedoeld voor klassikale instructie, formele toetsing of het vervangen van een gebarentolk.

Wat Google uitbrengt

Google DeepMind kondigde SL2T 1.0 op 12 augustus 2026 aan. De afkorting staat voor sign-language-to-text: het model zet een stroom gebaren om in geschreven tekst. Op de Pixel 11 wordt de functie eerst ingebouwd in twee Android-toepassingen:

  • In Gboard kan een gebruiker gebaren in plaats van typen, bijvoorbeeld voor een zoekopdracht, bericht, notitie, document of vraag aan Gemini.
  • In Live Transcribe kan een gebruiker tijdens een informeel gesprek een antwoord gebaren, de Engelse tekst controleren en die daarna bewust aan de gesprekspartner tonen of laten uitspreken.

De gebruiker houdt dus controle over het resultaat. De vertaling wordt als concept getoond en kan met het gewone toetsenbord worden aangepast voordat zij wordt verzonden. Google zegt dat later meer apparaten en gebarentalen volgen, maar noemt daarvoor nog geen planning. De functie start met ASL naar Engels en komt op de ondersteunde apparaten zonder meerprijs.

Voor Nederland en België is die taalgrens essentieel. Nederlandse Gebarentaal (NGT) en Vlaamse Gebarentaal (VGT) zijn zelfstandige talen en niet uitwisselbaar met ASL. Google heeft voor NGT of VGT nog geen beschikbaarheid aangekondigd. Het is daarom vooral nieuws over de richting van toegankelijke AI, niet over een hulpmiddel dat Nederlandse of Vlaamse scholen nu breed kunnen inzetten.

Hoe het model werkt

SL2T is getraind op meer dan 100.000 uur aan materiaal uit ruim vijftig gebarentalen; ongeveer een kwart van de trainingsdata bestaat uit ASL. Google laat het model verschillende talen, dialecten en vaardigheidsniveaus gezamenlijk leren. Volgens het bedrijf presteert dat beter dan training op één gebarentaal afzonderlijk.

De camera-opname gaat niet als gewone video naar het vertaalmodel. MediaPipe Holistic bepaalt op het apparaat per videoframe 130 punten op gezicht, lichaam en handen. Alleen de tweedimensionale coördinaten van die punten worden naar Googles servers gestuurd; de oorspronkelijke video wordt direct op het apparaat weggegooid. In het gezamenlijke impactrapport over SL2T 1.0 staat bovendien dat Google invoer en uitvoer niet logt, tenzij een gebruiker daar binnen een modelevaluatie expliciet toestemming voor geeft.

Deze aanpak verwijdert veel informatie over uiterlijk en omgeving, maar ook nuttige taalcontext. De puntenregistratie ziet bijvoorbeeld geen tongbeweging, mist diepte en weet niet naar welk voorwerp in de ruimte een gebaar verwijst. Het vertaalmodel moet vanuit die beperkte geometrie toch een Engelse zin opbouwen.

Google rapporteert sterke resultaten op eigen en bestaande ASL-benchmarks. Tegelijk laat het bedrijf concrete fouten zien bij zeldzame gebaren, snel vingerspellen, tijdsvormen en complexe ruimtelijke constructies. Een hoge benchmarkscore is daarom geen garantie dat iedere boodschap in een echte situatie klopt.

De kans: een extra manier om digitaal mee te doen

Voor volwassen ASL-gebruikers kan gebaren een natuurlijker en minder vermoeiend invoermiddel zijn dan typen in het Engels. Deelnemers aan Googles gebruiksonderzoek meldden vooral voordeel bij korte zoekopdrachten, berichten, navigatie, notities, brainstormen en vragen aan een digitale assistent. Live Transcribe kan daarnaast een extra route bieden voor een kort, informeel één-op-ééngesprek met een horende gesprekspartner.

Dat maakt de ontwikkeling relevant voor toegankelijkheidsbeleid in onderwijsinstellingen. Technologie ondersteunt gesproken en geschreven taal al jaren met dicteren, ondertiteling en vertaling. Gebarentalen kregen veel minder van zulke basisfuncties. SL2T laat zien hoe ontwerp met meerdere invoervormen digitale zelfstandigheid kan vergroten.

Ook de ontwikkelmethode is leerzaam. Google stelde een adviescommissie in met Dovenorganisaties, onderzoekers en deskundigen. Dove gebruikers waren betrokken bij het concept, de dataverzameling, tests en de beoordeling van maatschappelijke gevolgen. Voor scholen en leveranciers is dat een bruikbaar uitgangspunt: ontwerp toegankelijkheid niet alleen vóór een doelgroep, maar samen mét de mensen die de gevolgen ervaren.

Uitdrukkelijk niet voor les of toets

Het impactrapport trekt een opvallend scherpe grens rond onderwijs. SL2T 1.0 is niet ontworpen of gevalideerd voor formele academische beoordeling, klassikale instructie, gesprekken over individuele ondersteuning of het vervangen van een gebarentolk. Medische, juridische en andere beslissingen met grote gevolgen vallen eveneens buiten het bedoelde gebruik.

Daar zijn inhoudelijke redenen voor. Het systeem vertaalt alleen gebaren naar tekst en niet gesproken taal terug naar gebarentaal. Het kan geen verduidelijkende vragen stellen en mist het culturele en situationele oordeel van een bevoegde tolk. De ingebouwde controle werkt bovendien alleen wanneer de gebruiker voldoende Engels kan lezen om fouten te herkennen en het touchscreen kan bedienen om ze te herstellen.

Scholen mogen de functie daarom niet zien als een goedkope vervanging van professionele ondersteuning. Ook wanneer een vertaling meestal goed lijkt, kan één fout in een instructie, toetsvraag, ondersteuningsafspraak of beoordeling grote gevolgen hebben. Google en de adviescommissie stellen expliciet dat de techniek niet mag worden gebruikt om wettelijke toegankelijkheidsverplichtingen te omzeilen.

Nog duidelijke kwaliteitsgrenzen

De officiële evaluatie noemt beperkingen die in een onderwijscontext snel zwaar wegen:

  • gezichtsuitdrukkingen, hoofdbewegingen en andere niet-handmatige grammaticale signalen worden soms gemist;
  • regionale varianten, dubbelzinnige gebaren, eigennamen, afkortingen en cijferreeksen kunnen verkeerd worden vertaald;
  • het model kan soms tekst genereren terwijl iemand pauzeert of wanneer een tweede persoon in beeld komt;
  • weinig licht, tegenlicht, een ongunstige camerahoek of handen buiten beeld verlagen de kwaliteit;
  • het systeem volgt één persoon en begrijpt geen gesprek met meerdere gebaarders;
  • fragmenten duren maximaal zestig seconden en eerdere gespreksbeurten worden nog niet als context bewaard.

De evaluatiebasis is eveneens beperkt. SL2T 1.0 is vanwege juridische en privacyredenen niet getraind op en niet formeel getest met gebaarders onder de achttien jaar. De resultaten zeggen dus niet hoe betrouwbaar de functie is voor kinderen en jongeren. Ook formele uitsplitsingen naar onder meer motorische verschillen, leeftijd, regio en sociolinguïstische variatie zijn nog onvolledig.

Privacy en ongelijke toegang

Het lokaal verwijderen van de video is een betekenisvolle privacymaatregel, maar betekent niet dat er niets wordt verwerkt. De coördinaten van gezicht, lichaam en handen gaan voor vertaling naar Googles servers. Onderwijsinstellingen moeten bij eventueel gebruik dus nog steeds beoordelen welke gegevens worden verzonden, welke account- en apparaatinstellingen gelden en of een situatie überhaupt geschikt is voor cloudverwerking.

Ook toegang is ongelijk. De functie begint op de Pixel 11, vereist geschikte hardware en ondersteunt vooralsnog één vertaalrichting. Een instelling moet voorkomen dat leerlingen of medewerkers zelf een specifiek toestel moeten aanschaffen om basale toegankelijkheid te krijgen. Een persoonlijk hulpmiddel dat iemand vrijwillig gebruikt voor een informeel bericht is iets anders dan een voorziening waarop onderwijsdeelname of beoordeling afhankelijk wordt gemaakt.

Wat teams nu kunnen afspreken

  • Zet SL2T 1.0 niet in voor lesinstructie, formele toetsing, ondersteuningsgesprekken of andere beslissingen met gevolgen voor een leerling of student.
  • Vervang een bevoegde tolk of afgesproken toegankelijkheidsvoorziening niet door automatische vertaling.
  • Laat een volwassen ASL-gebruiker zelf bepalen of de functie bruikbaar is voor laagrisicotaken zoals zoeken, notities of informele berichten, en laat de gebruiker de Engelse tekst altijd controleren.
  • Leg in toegankelijkheidsbeleid het verschil vast tussen een persoonlijk extra hulpmiddel en een formele onderwijsvoorziening.
  • Bespreek nieuwe technologie samen met Dove en slechthorende leerlingen, studenten en medewerkers, en betrek waar nodig tolk- en toegankelijkheidsexpertise.
  • Wacht voor gebruik met minderjarigen, NGT of VGT op aantoonbare ondersteuning en passende evaluaties; ga niet uit van kwaliteit omdat ASL op één toestel werkt.
  • Controleer privacy, accountbeheer, apparaatvereisten en leveranciersafhankelijkheid voordat een pilot wordt overwogen.

De kern

Google brengt gebarentaal-AI voor het eerst als tekstinvoer naar alledaagse smartphonefuncties. Voor volwassen ASL-gebruikers kan dat meer zelfstandigheid en minder typelast betekenen. Voor het Nederlandse en Belgische onderwijs is de belangrijkste conclusie voorlopig begrenzing: geen NGT of VGT, geen evaluatie met minderjarigen en geen bedoeld gebruik voor instructie, toetsing of tolkvervanging. De ontwikkeling verdient aandacht als voorbeeld van inclusiever ontwerpen, maar niet als kant-en-klare onderwijsvoorziening.