En sprogmodel kan være ensproget eller flersproget afhængigt af om den er trænet på ét eller flere sprog. De fleste sprogmodeller er i dag flersprogede, og det sprog som modellerne er trænet på, er i langt overvejende grad engelsk. Kommunikationen med en ai-chatbot på dansk foregår derfor primært ved hjælp af en form for oversættelse eller tværsproglig mønstergenkendelse mellem sprog. Ved hjælp af såkaldt transferlæring overføres viden fra ét (eller flere) sprog til et andet internt i modellen. Overordnet set udgør transferlæring en kæmpe fordel for den kunstige intelligens’ udbredelse på verdens forskellige sprog: ChatGPT's store folkelige gennembrud i Danmark i 2022 kan i høj grad tilskrives det tekniske gennembrud på dette område uden hvilket værktøjet ville have været ganske ubehjælpsomt på dansk.
I de fleste flersprogede modeller udgør det danske træningsmateriale nemlig under én procent af det samlede sproginput som modellen er trænet med. Det betyder at modellerne ikke nødvendigvis kender alle de danske sproglige særtræk og forhold særlig godt, og at der derfor er fare for at de hallucinerer, dvs. opfinder noget ud fra de data (ofte engelske) de kender, som ikke nødvendigvis er rigtigt i den danske sammenhæng. Der kan også være meget gængse sproglige figurer på dansk som modellen undlader at bruge fordi den ikke har mødt dem i tilstrækkelig grad i sit træningsmateriale. Fx bruger vi på dansk ofte ordet man som ikke findes helt tilsvarende på engelsk, hvorfor en sprogmodel som oftest vil sige du.
Falske venner hvor et engelsk og et dansk ord ligner hinanden, men ikke betyder helt det samme, kan også give problemer i den flersprogede model. Det gælder fx det engelske navneord form, som kan betyde enten 'form/facon' eller 'formular' på dansk afhængigt af konteksten. Det kan føre til fejlagtig tekstproduktion som i du kan udfylde denne form hvor der retteligt skulle have stået du kan udfylde denne formular.
Hvor mange sprogdata er vigtige for en sprogmodels almene formåen (også på dansk), er sprogdata som er specifikt danske, vigtige for at få de sproglige og kulturelle nuancer repræsenteret helt korrekt. Danske (og andre mindre sprogs) særtræk kan enten tilføres fra starten når man træner en model, eller de kan tilføjes via eftertræning hvor man beriger en allerede trænet flersproget grundmodel med særlig viden om dansk, fx i form af dertil udviklede datasæt.
Kommentarer
Kommentarer til artiklen bliver synlige for alle. Undlad at skrive følsomme oplysninger, for eksempel sundhedsoplysninger. Fagansvarlig eller redaktør svarer, når de kan.
Du skal være logget ind for at kommentere.