Google DeepMind heeft een nieuwe vorm van AI-vertaling voor gebarentaal uitgerold waarmee dove en slechthorende gebruikers rechtstreeks naar hun telefoon kunnen gebaren in plaats van te typen, in wat het bedrijf een echte doorbraak voor toegankelijkheidstechnologie noemt. Het model, onthuld op 12 augustus 2026, heet SL2T — kort voor sign-language-to-text — en het markeert de eerste keer dat dit soort technologie uit onderzoekslabs komt en terechtkomt in alledaagse consumentenapps zoals Gboard en Live Transcribe.
Summary
Belangrijkste punten
- Google DeepMind heeft SL2T gelanceerd, een meertalig gebarentaalmodel dat gebaren rechtstreeks omzet in geschreven tekst.
- Het ondersteunt momenteel American Sign Language (ASL) naar Engels binnen Gboard en Live Transcribe op de Pixel 11, zonder extra kosten.
- Het model is getraind op meer dan 100.000 uur aan data in meer dan 50 gebarentalen en behaalt 70 BLEURT op de FLEURS-ASL-benchmark, ruim boven eerdere modellen.
- SL2T volgt pose-landmarks in plaats van ruwe video om de privacy van gebruikers te beschermen en verwijdert camerabeelden onmiddellijk.
- Leden van de Dovengemeenschap hebben het project vanaf het begin vormgegeven, en Google heeft het AI Sign Language Advisory Committee (AISLAC) opgericht om de uitrol te begeleiden.
Google DeepMind lanceert SL2T, een meertalig AI-vertaalmodel voor gebarentaal
SL2T is DeepMinds antwoord op een leemte die al jaren in AI bestaat: terwijl hulpmiddelen voor gesproken taal zoals dicteren en automatische vertaling de afgelopen twee decennia gemeengoed zijn geworden, bleven de meer dan 200 gebarentalen wereldwijd — gebruikt door naar schatting 70 miljoen dove en slechthorende mensen — grotendeels buiten beeld. DeepMind beschrijft SL2T als een “massively multilingual” systeem dat is gebouwd om die kloof te dichten met een betekenisvolle sprong in zowel vertaalkwaliteit als taaldekking.
Het praktische resultaat is een nieuw soort dicteren. Net zoals horende gebruikers kunnen spreken in plaats van typen, laat SL2T dove gebruikers naar hun telefoon gebaren overal waar ze normaal zouden typen — het web doorzoeken, berichten of documenten opstellen, of Gemini vragen een taak uit te voeren. In Live Transcribe kunnen gebruikers hun kant van een gesprek gebaren in plaats van heen en weer te typen met een horend persoon. Volgens Googles eigen testers voelde gebaren in ASL sneller en natuurlijker dan het equivalent in het Engels uittypen.
ASL-ondersteuning in Gboard en Live Transcribe op Pixel 11
Voorlopig ondersteunt de technologie één taalkoppel: American Sign Language vertaald naar Engels. Het is eerst beschikbaar binnen Gboard en Live Transcribe op de Pixel 11, en Google belooft dat meer apparaten en extra gebarentalen onderweg zijn. Opvallend is dat de functie zonder extra kosten aan gebruikers wordt aangeboden, waardoor het wordt gepositioneerd als een standaard toegankelijkheidsfunctie in plaats van een premium toevoeging.
Hoe het meertalige gebarentaalmodel is gebouwd
SL2T is getraind op een dataset van meer dan 100.000 uur verspreid over meer dan 50 gebarentalen, waarvan ongeveer een kwart specifiek in ASL. Het model in één keer trainen op veel talen en vaardigheidsniveaus, in plaats van afzonderlijke eentalige systemen te bouwen, hielp het gedeelde structuren te leren die de algehele prestaties verbeterden — het presteerde beter dan eentalige modellen in DeepMinds eigen tests.
Die schaal zie je terug in de cijfers. Op de FLEURS-ASL-benchmark, die de kwaliteit van ASL-naar-Engelsvertaling meet, behaalde SL2T een zero-shot-score van 70 BLEURT — een cijfer waarvan DeepMind zegt dat het aanzienlijk hoger ligt dan alles wat eerder voor dit soort taak is gerapporteerd. Dat verschil is belangrijk: het geeft aan dat SL2T niet slechts een incrementele verbetering is, maar een sprong voorwaarts in hoe goed AI gebarentaal kan begrijpen als volwaardige taal, in plaats van als een reeks handgebaren die aan woorden worden gekoppeld.
Een deel van de moeilijkheid is dat gebarentalen niet simpelweg gesproken taal zijn uitgevoerd met handen. Ze hebben hun eigen grammatica, woordenschat en structuur, en ze dragen betekenis over via gelijktijdige beweging van handen, armen, romp, hoofd en gezicht. Dat alles in realtime volgen is een veeleisend computervisieprobleem, en het is een van de redenen waarom eerdere pogingen — zoals handschoenen voor gebarentaal — het moeilijk hadden, omdat ze gebaren behandelden als een beperkte hand-trackingtaak in plaats van als echte taalvertaling.
Pose-landmarks beschermen de privacy van gebarende gebruikers
In plaats van ruwe video naar een server te sturen, verwerkt SL2T gebaren als een stroom van pose-landmarkcoördinaten. Een on-device model genaamd MediaPipe Holistic volgt punten op het lichaam van de gebarende persoon, en alleen die geometrische coördinaten — niet de camerabeelden zelf — worden doorgestuurd voor vertaling. De oorspronkelijke video wordt onmiddellijk verwijderd; dit is DeepMinds manier om privacybescherming direct in de architectuur van het systeem in te bouwen in plaats van het als een bijzaak te behandelen.
Glosses overslaan voor directe vertaalnauwkeurigheid
SL2T breekt ook met een veelgebruikte aanpak in eerder onderzoek naar gebarentaal: het vertaalt coördinatenreeksen rechtstreeks naar tekst en slaat tussentijdse stapsgewijze annotaties, zogenaamde “glosses”, over. Glosses missen vaak de rijkere, niet-lineaire onderdelen van gebarentalen, waaronder gezichtsuitdrukkingen en ruimtelijke constructies die echte betekenis dragen. Door die stap over te slaan, vermijdt SL2T kunstmatige beperkingen in de woordenschat en laat het de vertaalkwaliteit direct opschalen met meer data.
Google zegt dat het ook aan praktische, realistische kwesties heeft gewerkt die verder gaan dan benchmarkscores — het verminderen van vertraging bij streaming, het vermijden van foutieve vertalingen wanneer iemand niet daadwerkelijk aan het gebaren is, en het specifiek verbeteren van de nauwkeurigheid voor de ongeveer 10% van de gebarende mensen die linkshandig zijn, evenals voor mensen die eenhandig gebaren terwijl ze hun telefoon in de andere hand houden.
Dovengemeenschap gaf vorm aan de ontwikkeling van SL2T
DeepMind presenteert dit als een project dat is gebouwd met de Dovengemeenschap in plaats van alleen voor die gemeenschap. Het idee kwam van Sam Sepah, een dove Googler, en dove partners waren betrokken bij de dataverzameling, gebruikerstests en de evaluatie van de daadwerkelijke impact van de technologie.
Om die betrokkenheid gestructureerd te houden na de eerste lancering, heeft Google het AI Sign Language Advisory Committee (AISLAC) opgericht, waarin wereldwijde dove organisaties en inhoudsdeskundigen samenkomen om te helpen sturen hoe de technologie in de toekomst wordt ingezet. Het bedrijf schreef ook samen met gemeenschapspartners een gezamenlijk impactrapport voor deze eerste release, waarin zowel wordt uiteengezet wat SL2T kan als waar de huidige grenzen liggen — een aanpak die Google zegt te willen herhalen voor toekomstige releases rond gebarentaal.
Wat is de volgende stap voor AI-vertaling van gebarentaal
DeepMind positioneert ASL-ondersteuning als een startpunt in plaats van een eindpunt. Het team zegt te werken aan het uitbreiden van SL2T naar extra gebarentalen, het verkennen van generatie van gebarentaal — in wezen het omgekeerde proces waarbij tekst wordt omgezet in gebaren — en het toevoegen van meer geavanceerde AI-mogelijkheden boven op het bestaande model.
De bredere ambitie sluit aan bij Googles lang uitgesproken doel om informatie universeel toegankelijk te maken. Dat doel bereiken voor Dovengemeenschappen betekent dat gebarentalen dichter bij gelijkwaardigheid komen met gesproken en geschreven talen in digitale producten, en niet alleen dat er één functie op één apparaat wordt uitgebracht. Of de vroege ASL-resultaten van SL2T standhouden wanneer het wordt uitgebreid naar tientallen andere gebarentalen, elk met hun eigen grammatica en regionale variatie, zal waarschijnlijk bepalen hoe snel die bredere visie werkelijkheid wordt voor gebruikers buiten de Pixel 11.
FAQ
Wat is SL2T en wat doet het?
SL2T is het meertalige sign-language-to-text-model van Google DeepMind. Het vertaalt gebaren rechtstreeks naar geschreven tekst, zodat dove gebruikers naar hun telefoon kunnen gebaren om berichten te typen, te zoeken of te communiceren in plaats van een toetsenbord te gebruiken.
Welke gebarentalen ondersteunt SL2T momenteel?
Op dit moment ondersteunt SL2T alleen American Sign Language vertaald naar Engels, en het is beschikbaar via Gboard en Live Transcribe op de Pixel 11. Extra gebarentalen zijn gepland voor toekomstige releases.
Hoe beschermt SL2T de privacy van gebruikers tijdens vertaling van gebarentaal?
SL2T draait een on-device trackingsysteem dat punten op het lichaam van een gebarende persoon leest in plaats van ruwe video ergens heen te sturen. Alleen die coördinaten worden gebruikt voor vertaling, en de camerabeelden zelf worden direct verwijderd.
Hoe is de Dovengemeenschap betrokken bij het SL2T-project?
Dove personen waren betrokken vanaf de vroegste conceptfase tot en met dataverzameling, testen en governance. Google heeft ook het AI Sign Language Advisory Committee opgericht, bestaande uit dove organisaties en experts, om te helpen sturen hoe de technologie zich verder ontwikkelt.
{“@context”:”https://schema.org”,”@type”:”FAQPage”,”mainEntity”:[{“@type”:”Question”,”name”:”Wat is SL2T en wat doet het?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”SL2T is het meertalige sign-language-to-text-model van Google DeepMind. Het vertaalt gebaren rechtstreeks naar geschreven tekst, zodat dove gebruikers naar hun telefoon kunnen gebaren om berichten te typen, te zoeken of te communiceren in plaats van een toetsenbord te gebruiken.”}},{“@type”:”Question”,”name”:”Welke gebarentalen ondersteunt SL2T momenteel?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”Op dit moment ondersteunt SL2T alleen American Sign Language vertaald naar Engels, en het is beschikbaar via Gboard en Live Transcribe op de Pixel 11. Extra gebarentalen zijn gepland voor toekomstige releases.”}},{“@type”:”Question”,”name”:”Hoe beschermt SL2T de privacy van gebruikers tijdens vertaling van gebarentaal?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”SL2T draait een on-device trackingsysteem dat punten op het lichaam van een gebarende persoon leest in plaats van ruwe video ergens heen te sturen. Alleen die coördinaten worden gebruikt voor vertaling, en de camerabeelden zelf worden direct verwijderd.”}},{“@type”:”Question”,”name”:”Hoe is de Dovengemeenschap betrokken bij het SL2T-project?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”Dove personen waren betrokken vanaf de vroegste conceptfase tot en met dataverzameling, testen en governance. Google heeft ook het AI Sign Language Advisory Committee opgericht, bestaande uit dove organisaties en experts, om te helpen sturen hoe de technologie zich verder ontwikkelt.”}}]}
Artikel geproduceerd met hulp van kunstmatige intelligentie en beoordeeld door de redactie.

