Stel een vraag in het Engels of Mandarijn aan een groot AI‑model en de kans is groot dat het vloeiend en genuanceerd antwoordt. Stel het een vraag in het Kantonees en de scheurtjes worden zichtbaar. Precies dat gat probeert een startup uit Hongkong met de naam Votee AI te dichten, door een Kantonees AI‑model te bouwen dat is ontworpen om banken, universiteiten en overheidsdiensten te bedienen in een taal die door de grootste AI‑labs grotendeels is genegeerd.
Summary
Belangrijkste punten
- De meeste toonaangevende AI‑modellen, gebouwd door bedrijven als OpenAI, Anthropic, DeepSeek, Moonshot AI en Z.ai, worden primair in het Engels en Mandarijn ontwikkeld omdat hun makers in de VS of het vasteland van China zijn gevestigd.
- Kantonees wordt wereldwijd door meer dan 80 miljoen mensen gesproken, maar heeft een veel kleinere hoeveelheid gestandaardiseerde digitale tekst dan Mandarijn, waardoor het een schoolvoorbeeld is van een “low‑resource‑taal” voor AI‑training.
- Votee AI traint open‑weight‑modellen zoals Meta’s Llama opnieuw op Kantonees‑data en vergrootte zijn trainingscorpus van 100 miljoen naar meer dan 500 miljoen tokens via scraping, communitybronnen en synthetische data.
- De resulterende modellen draaien rond de 70 miljard parameters, kleiner dan frontier‑systemen, en kosten ongeveer $250.000 om te trainen met tussen de 500 miljoen en 1 miljard tokens, een fractie van wat Engelstalige modellen vereisen.
- Het bedrijf plaatst zijn werk in de context van een bredere “soevereine AI”‑beweging en is nu in gesprek om via AI Singapore uit te breiden naar Zuidoost‑Azië.
De dominantie van Engels en Mandarijn in AI laat Kantonees achter
De huidige AI‑hausse draait vrijwel volledig op twee talen. Volgens Pak‑Sun Ting, CEO van Votee AI, speelt “de hele AI‑revolutie zich af in Engels en Mandarijn” en “is er maar een heel klein deel dat andere talen vertegenwoordigt.” Die scheefgroei is geen toeval. De bedrijven die het veld aanvoeren — OpenAI, Anthropic, DeepSeek, Moonshot AI, Z.ai en andere — zijn bijna allemaal gevestigd in de Verenigde Staten of op het vasteland van China, dus het is geen verrassing dat hun vlaggenschipmodellen het sterkst zijn in de moedertalen van hun makers.
Daardoor blijven tientallen veelgesproken talen, en nog meer regionale dialecten, ver achter in AI‑capaciteit. Kantonees is een opvallend voorbeeld van hoe groot die kloof kan zijn, zelfs voor een taal die dagelijks door tientallen miljoenen mensen wordt gesproken.
Waarom Kantonees een andere taal spreekt dan Mandarijn
Kantonees wordt vaak omschreven als een “dialect” van het Chinees, maar dat label doet geen recht aan hoe verschillend het werkelijk is. Het heeft een andere grammatica dan Mandarijn en een eigen woordenschat, en in Hongkong mengen sprekers vaak Engelse en Kantonese woorden in dezelfde zin. Meer dan 80 miljoen mensen spreken wereldwijd Kantonees, een aantal dat ongeveer gelijk is aan het aantal Koreaanse sprekers en groter is dan de populaties die Italiaans of Thais spreken.
Ondanks die schaal heeft Kantonees lang niet zoveel gestandaardiseerde geschreven tekst voortgebracht als Mandarijn of Engels. Benchmarks zoals HKCanto‑Eval, ontwikkeld door onderzoekers van de Kyushu‑universiteit en de Education University of Hong Kong samen met de lokale AI‑community hon9kon9ize, en gesponsord door Votee, laten zien dat mainstream AI‑modellen alledaags Kantonees redelijk aankunnen maar routinematig struikelen over culturele en lokale kennis. Zoals Ting het verwoordt, wordt Kantonees “gebruikt in het onderwijs, de gezondheidszorg en de communicatie van de politie”, dus wanneer AI het niet goed dekt, is “AI in wezen nutteloos.”
De aanpak van Votee AI bij het bouwen van een Kantonese AI
In plaats van een model helemaal vanaf nul te bouwen, neemt Votee een bestaand open‑weight‑systeem, zoals Meta’s Llama of Alibaba’s Qwen, en traint dat intensief opnieuw op Kantonese data. Ting beschrijft het proces als “in wezen dezelfde stappen nemen alsof je een model vanaf nul traint”, maar dan bovenop iemands anders fundament. De opnieuw getrainde systemen worden vervolgens verkocht aan banken, universiteiten en overheidsdiensten die AI‑tools nodig hebben die in Kantonees kunnen werken in plaats van standaard naar Mandarijn of Engels te schakelen.
Data verzamelen van omroepen en synthetische sets
Een bruikbaar corpus opbouwen voor een AI‑project in een low‑resource‑taal betekent data bij elkaar schrapen waar die maar te vinden is. Votee haalt Kantonese tekst binnen via online scraping, waaronder content van Radio Television Hong Kong, de publieke omroep van de stad. Dat wordt aangevuld met materiaal van universiteiten, de bredere gemeenschap en archieven uit de eerdere periode als big‑databedrijf. Waar echte tekst tekortschiet, genereert Votee eigen synthetische Kantonese datasets om de gaten te vullen. Gezamenlijk hebben die inspanningen het Kantonese corpus van het bedrijf opgevoerd van 100 miljoen tokens naar meer dan 500 miljoen tokens.
Modelgrootte en trainingskosten vergeleken met frontier‑labs
De resulterende modellen van Votee zitten rond de 70 miljard parameters, duidelijk kleiner dan de leidende systemen van de top‑labs. Toch zegt Ting dat de modellen capabel genoeg zijn om Kantonees te begrijpen en te redeneren voor de praktische taken die hun klanten nodig hebben. De economische kant spreekt voor zich: Votee traint zijn modellen op tussen de 500 miljoen en 1 miljard tokens, tegen een geschatte kostprijs van ongeveer $250.000. Frontier‑modellen in het Engels worden daarentegen getraind op triljoenen tokens tegen veel hogere kosten. Dat prijsverschil is precies waarom een kleiner, gericht Kantonees AI‑model commercieel haalbaar kan zijn voor een startup in plaats van alleen voor een techgigant.
Die kostenstructuur is ook buiten Votee zelf van belang. Ze suggereert dat het bedienen van een AI‑markt voor low‑resource‑talen geen miljardeninvesteringen in frontier‑labs vereist — maar wel een bruikbaar open‑weight‑basismodel, een degelijke datapijplijn en een fractie van de rekenkracht. Dat is een betekenisvol signaal voor andere onderbediende talen die toekijken hoe de ontwikkeling van Kantonese AI zich ontvouwt.
Soevereine AI en de stap naar Zuidoost‑Azië
Het werk van Votee past in een bredere trend die bekendstaat als soevereine AI: het idee dat overheden en bedrijven hun eigen data, modellen en infrastructuur willen bezitten in plaats van volledig afhankelijk te zijn van aanbieders in het buitenland. “AI is zo’n essentiële behoefte geworden, en dus wil je niet vastzitten aan iemand anders die het kan uitzetten,” zegt Ting.
De stack (deels) in eigen hand hebben
Ting is er duidelijk over dat de meest volledige versie van soevereine AI, waarbij een land elke schakel in de AI‑keten controleert, in de praktijk “heel moeilijk” te realiseren is. Zijn realistischer voorstel is dat landen de nadruk leggen op het in bezit hebben van zowel de onderliggende foundation‑modellen als de softwaresystemen die daarop zijn gebouwd. Hij merkt ook op dat overheden zelden frontier‑niveau kracht nodig hebben om specifieke taken te automatiseren — zelfs een model met slechts 1 miljard parameters kan geschikt zijn voor smallere overheidsuse‑cases, of een kleinere lokale‑taallaag kan simpelweg de output routeren van een groter Engels of Chinees model.
Hardware‑partnerschappen en wat volgt
Votee beperkt zich niet tot één ecosysteem. Ting zegt dat het bedrijf werkt met modellen van MiniMax en SenseTime en operaties kan draaien op Nvidia‑chips. “We kunnen Nvidia‑chips gebruiken, we kunnen het model van Moonshot of DeepSeek gebruiken,” zegt hij. “Wij zijn die persoon op de middelbare school die met iedereen bevriend is.” Votee omschrijft zichzelf als winstgevend in de zin dat de inkomsten de kosten overstijgen, grotendeels gefinancierd via klantcontracten, en rekent de Hongkongse tycoon Allan Zeman, bekend van de ontwikkeling van de uitgaanswijk Lan Kwai Fong in de stad, tot zijn adviseurs.
De ambities van het bedrijf reiken nu verder dan Hongkong. Ting zegt dat Votee in actieve gesprekken is met AI Singapore en van plan is verder uit te breiden in Zuidoost‑Azië. Hij kijkt ook naar een langetermijndoel: AI gebruiken om bedreigde talen te helpen beschermen in regio’s als Oost‑Azië, Noord‑Amerika en Afrika. Ting schetst de inzet in scherpe bewoordingen en noemt de dominantie van Engelstalige AI een “typemachinemoment”, waarbij de productiviteitswinst zo groot is dat mensen hun eigen taal opgeven om bij te blijven. “Mensen zullen Engels aannemen alleen omdat de productiviteit van de typemachine zo sterk is vergeleken met hun eigen taal,” zegt hij. Of een Kantonese AI met 70 miljard parameters die aantrekkingskracht daadwerkelijk kan tegengaan, blijft een open vraag, maar voor Ting gaat de motivatie dieper dan marktaandeel. “Elke taal die sterft, betekent dat je een manier verliest om naar de wereld te kijken,” zegt hij.
FAQ
Waarom richt Votee AI zich op Kantonees voor AI‑modelontwikkeling?
Omdat Kantonees, dat door meer dan 80 miljoen mensen wordt gesproken, aanzienlijk verschilt van Mandarijn en onderbediend is in AI, wat gevolgen heeft voor sectoren zoals onderwijs en gezondheidszorg, waar nauwkeurige tools in de lokale taal essentieel zijn.
Hoe bouwt Votee AI zijn Kantonese AI‑modellen?
Votee AI traint open‑weight‑modellen van ontwikkelaars zoals Meta opnieuw met Kantonese data die is verzameld via scraping, communitybronnen, universiteiten en synthetische data, waardoor het corpus groeide van 100 miljoen naar meer dan 500 miljoen tokens.
Wat is soevereine AI en hoe verhoudt Votee AI zich daartoe?
Soevereine AI verwijst naar overheden en bedrijven die hun eigen AI‑data, modellen en infrastructuur bezitten in plaats van volledig te vertrouwen op buitenlandse aanbieders. Votee AI ondersteunt dit idee door AI‑modellen te lokaliseren voor Kantonees en samen te werken met lokale en wereldwijde hardware‑ en modelaanbieders.
Wat zijn de plannen van Votee AI voor regionale uitbreiding?
Votee AI is in actieve gesprekken met AI Singapore en is van plan uit te breiden naar Zuidoost‑Azië, terwijl het ook onderzoekt hoe AI kan helpen bedreigde talen in andere delen van de wereld te beschermen.
{“@context”:”https://schema.org”,”@type”:”FAQPage”,”mainEntity”:[{“@type”:”Question”,”name”:”Waarom richt Votee AI zich op Kantonees voor AI-modelontwikkeling?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”Omdat Kantonees, dat door meer dan 80 miljoen mensen wordt gesproken, aanzienlijk verschilt van Mandarijn en onderbediend is in AI, wat gevolgen heeft voor sectoren zoals onderwijs en gezondheidszorg, waar nauwkeurige tools in de lokale taal essentieel zijn.”}},{“@type”:”Question”,”name”:”Hoe bouwt Votee AI zijn Kantonese AI-modellen?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”Votee AI traint open-weight-modellen van ontwikkelaars zoals Meta opnieuw met Kantonese data die is verzameld via scraping, communitybronnen, universiteiten en synthetische data, waardoor het corpus groeide van 100 miljoen naar meer dan 500 miljoen tokens.”}},{“@type”:”Question”,”name”:”Wat is soevereine AI en hoe verhoudt Votee AI zich daartoe?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”Soevereine AI verwijst naar overheden en bedrijven die hun eigen AI-data, modellen en infrastructuur bezitten in plaats van volledig te vertrouwen op buitenlandse aanbieders. Votee AI ondersteunt dit idee door AI-modellen te lokaliseren voor Kantonees en samen te werken met lokale en wereldwijde hardware- en modelaanbieders.”}},{“@type”:”Question”,”name”:”Wat zijn de plannen van Votee AI voor regionale uitbreiding?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”Votee AI is in actieve gesprekken met AI Singapore en is van plan uit te breiden naar Zuidoost-Azië, terwijl het ook onderzoekt hoe AI kan helpen bedreigde talen in andere delen van de wereld te beschermen.”}}]}
Artikel geproduceerd met behulp van kunstmatige intelligentie en beoordeeld door de redactie.

