Helsingin Sanomien paljon keskustelua herättäneessä testissä kielimallit asetettiin poliittiselle arvokartalle. Tässä artikkelissa käydään läpi, mitä tutkimus tällaisista testeistä sanoo, ja tiivistetään se neljään havaintoon: ilmiö toistuu, mutta mittaus on epävakaa, alkuperä monikerroksinen ja neutraalius kiistanalainen. Kirjoittaja varoittaa, että jos koneen tuottamaa tietoa aletaan lukea oletetun poliittisen värin läpi, luottamus tietoon voi rapautua, kuten journalismille on monessa maassa käynyt.
Kirjoittaja: Harri Heikkilä
Helsingin Sanomien testissä 24 kielimallia vastasi vaalikoneen väittämiin, ja kaikki asettuivat kartalla liberaalille puolelle ja suurin osa vasemmalle (Niskakangas & Salminen 2026). Vastaavia testejä on tehty aiemminkin. Hartmann ym. (2023) saivat samankaltaisen tuloksen ChatGPT:llä kahdella eurooppalaisella vaalikoneella, Motoki ym. (2024) huomasivat vastaavan kallistuman kolmessa maassa, ja Santurkar ym. (2023) havaitsivat mallien vastausten muistuttavan eniten liberaalien amerikkalaisvastaajien mielipiteitä.
Kompassi vai pyörivä nuoli?
Röttger ym. (2024) kuitenkin kritisoivat asetelmia, joissa tekoäly pakotetaan vastaamaan monivalintakysymyksiin. Heidän keskeinen havaintonsa on, että testitulos ei välttämättä mittaa mallin poliittista ominaisuutta, vaan kyse on paljolti siitä, että kysymyksen muotoilu, vastausformaatti ja konteksti pakottavat mallin tuottamaan tietynlaisen vastauksen. Kysymyksen vähäinenkin uudelleenmuotoilu saattoi siirtää mallin sijaintia kartalla. Mallit on koulutettu esittämään useita näkökulmia, joten pakotettu puolen valinta sopii niille huonosti. Avoimissa vastauksissa mallit käsittelivät kysymyksiä ehdollisesti ja monesta näkökulmasta ja näyttivät yleisesti oikeistolaisemmilta. Tutkijoiden metafora on osuva: poliittinen kompassi muistuttaa kielimallien tapauksessa enemmänkin pyörivää nuolta. Heidän johtopäätöksensä on, että malleja ei edes pitäisi kuvata yksinkertaisesti poliittisella janalla, ja he suosittavat tulosten lukemista vain paikallisina väitteinä tietystä tehtävästä, ei yleisinä väitteinä mallin arvoista. (Röttger ym. 2024.)
Dominguez-Olmedo ym. (2024) osoittivat saman ongelman toisesta suunnasta: kielimallien kyselyvastauksia voivat ohjata kyselymuodon tekniset piirteet. Vastauksiin vaikuttavat muun muassa vaihtoehtojen järjestys ja jopa kirjaintunnisteet: malli voi suosia vaihtoehtoa A sen sisällöstä riippumatta. Kun tutkijat vakioivat vaihtoehtojen järjestyksen, vastaukset lähestyivät lähes satunnaista jakaumaa vaihtoehtojen välillä. Toisaalta Röttger ym. (2026) mittasivat malleja myös todellisia kirjoitustilanteita jäljittelevillä kehotteilla ja löysivät silti järjestelmällisiä aihekohtaisia kallistumia, samansuuntaisia mallista toiseen ja osassa aiheita lähempänä Yhdysvaltain demokraattien kuin republikaanien äänestäjien kantoja. Myöskään Buylin ym. (2026) menetelmässä ei käytetty yksinkertaista väittämäasteikkoa: he pyysivät 19 mallia kuvailemaan vapaana tekstinä lähes neljäätuhatta poliittisesti merkittävää henkilöä ja arvioivat vasta jälkikäteen, kuinka suopeasti kukin kuvattiin. Liberaaleiksi tulkittavia eroja löytyi näinkin. Asteikkokysely on siis yksinkertaistus, mutta samansuuntaisia tuloksia on saatu myös erilaisilla menetelmillä.
Mistä vinoumat johtuvat?
Mahdollisia lähteitä on koko ketju koulutusdatasta käyttäjän kysymykseen: perusmalli, ihmispalaute, hienosäätö ja järjestelmäohjeet muokkaavat kukin omaa kerrostaan. HS:n jutussa haastateltu professori Hannu Toivonen selittää tulosta koulutusaineistolla ja kouluttajien maailmankatsomuksella, ja jutun kärki on jälkimmäisessä: malliin jää ”väkisinkin” jälki kouluttajan ja yhtiön arvoista (Niskakangas & Salminen 2026). Kaksi vuotta aiemmin sama professori tosin piti vihervasemmistolaiseksi julistamista ”tarpeettomana kärjistyksenä”, varoitti sanamuotojen ohjaavan vastauksia ja arveli syyksi opetusaineistoa, jossa laadukasta materiaalia kertyy enemmän liberaalilta laidalta (Keski-Heikkilä 2023).
Ceron ym. (2025) analysoivat avoimen OLMo 2 -mallin koko koulutusdatan: amerikkalaisittain vasemmalle kallistuva sisältö oli esikoulutusaineistossa vallitsevaa, ja datan kannat korreloivat mallin kantojen kanssa. Myös Feng ym. (2023) osoittivat, että poliittinen vinouma omaksutaan jo esikoulutuskorpuksista. Xu ym. (2025) päätyivät samaan Yhdysvaltain korkeimman oikeuden tapauksilla: mallit heijastavat koulutuskorpuksensa painotuksia. Korpuksen painotukseen sopii sekin, että HS:n testissä yhdeksän kiinalaista mallia, DeepSeek mukaan lukien, asettui samaan liberaaliin rykelmään länsimaisten kanssa. Kehittäjätaustat eroavat jyrkästi, mutta mallit käyttävät osin samaa kansainvälistä verkkoaineistoa. Vastaväitteenä voi esittää, että Rozadon (2024) kokeissa pienelläkin suunnatulla datalla mallin sai siirrettyä kartalla haluttuun kohtaan. Hienosäätö siis liikuttaa testipistettä, mutta mittarina oli sama pakotettu vastaustesti, joten siirtymä ei vielä kerro, muuttuuko käyttäytyminen todellisissa käyttötilanteissa.
Hienosäädön vaikutusta havainnollistaa myös Grok. ”Woke-kriittisesti” viritetyksi väitetty malli siirtyi HS:n testissä poliittisella nelikartalla vain hiukan: se erottui lähinnä talouskysymyksissä, mutta asettui muuten muiden tavoin liberaaliin rykelmään. Kun Grokia ohjeistettiin kesällä 2025 puhumaan suoremmin ja ohittamaan ”puolueellinen” media, malli tuotti poliittisiin kysymyksiin asiattomia ja loukkaavia vastauksia (Krupa 2025). HS:n toistoissa Grok ja DeepSeek myös horjuivat vastauksissaan selvästi muita enemmän. Horjunta voi kertoa koulutuskerrosten jännitteistä: mallin hienosäätäminen korpuksen vastaiseksi ei ehkä toimi kovin koherentisti.
Poliittinen käyttäytyminen ei myöskään ongelmitta palaudu yksiulotteiselle vasemmisto–oikeisto-akselille. Se voi näkyä kannanotoissa, aihepainotuksissa, henkilökuvausten suopeudessa ja siinä, mistä malli kieltäytyy puhumasta. Vasemmisto–oikeisto-sijainti mittaa näistä vain osaa. DeepSeek (kuva 1) havainnollistaa poliittisen käyttäytymisen toista ulottuvuutta, sensuuria ja herkkien aiheiden käsittelyä: Buylin ym. (2026) aineistossa kiinankieliset vastaukset myötäilivät enemmän Kiinan linjaa.

Kuva 1. Kirjoittajan DeepSeek-kokeilut tammikuussa 2025 havainnollistavat, miten poliittinen käyttäytyminen voi näkyä herkkien aiheiden käsittelyssä: vastaukset Falun Gongista, Tiananmenista ja uiguureista myötäilevät Kiinan hallinnon linjaa. Kuvakaappaukset ovat yksittäisiä havaintoja, eivät järjestelmällinen testi. Myöhemmin kokeiltaessa DeepSeek kieltäytyi vastaamasta kokonaan näihin kysymyksiin. Kansainväliset mediat ovat raportoineet samoista rajoituksista (Lu 2025).
Neutraaliuden illuusio
Niskakankaan ja Salmisen (2026) HS-artikkelissa huomautetaan, ettei arvokartan keskilinja edusta neutraalia kantaa, vaan nollapiste kiinnittyy vuoden 2025 vaalien ehdokaskentän mielipiteisiin. Kartta ei siis sijoita mallia yleiseen poliittiseen avaruuteen vaan tietyn maan, ajan ja kysymyspatterin muodostamaan vertailuasetelmaan.
Tällä nollapisteellä on lisäksi aikaulottuvuus. Korpus on hidas: yli vuosisadan aikana kertynyttä tekstiä, jonka kokoaminen päättyy tiettyyn hetkeen. Se ei ole neutraali aikakapseli, sillä aineistoa valitaan ja painotetaan, ja myöhemmät koulutusvaiheet tuovat uudempia vaikutteita. Vertailuväestö on aina nopeampi, sillä ehdokaskenttä ja poliittinen keskipiste elävät vaalikaudesta toiseen. Jos keskipiste siirtyy, ennallaan pysyvä malli alkaa näyttää siirtyneeltä vastakkaiseen suuntaan, vaikka sen käyttäytymisessä ei muutu mikään. Puoluekenttien liike on Euroopassa dokumentoitu ilmiö (Norris & Inglehart 2019), joten kysymys ei ole hypoteettinen.
Keskikohta ei myöskään tarkoita totuutta, sillä mielipiteiden keskiarvo voi olla väärässä siinä missä yksittäinen mielipidekin. Päättelyvirhe tunnetaan kultaisen keskitien virhepäätelmänä. Rozado (2024) huomauttaa lisäksi, että lähelle keskikohtaa osuva pistemäärä voi tarkoittaa kahta eri asiaa: maltillisia näkemyksiä tai eri laitoihin meneviä vastauksia, jotka keskiarvoistuvat keskelle. Journalismin tutkimus tuntee läheisen ilmiön omalla nimellään: tasapuolisuusvinouma eli balance as bias (Boykoff & Boykoff 2004). Ilmastouutisissa molempien puolten tasaveroinen kuuleminen loi kuvan kiistasta, jota tutkimuksessa ei ollut. Ilmastoväite ei ole ”punavihreä” siksi, että tieto olisi poliittista, vaan siksi, että ehdokkaiden kanta siitä jakautuu. Kartalla väite perii poliittisen merkityksensä vertailuväestön erimielisyydestä, ei tiedon sisällöstä. Malli, joka hakisi keskikohtaa myös faktakysymyksissä, näyttäisi kartalla neutraalimmalta, mutta olisi arveluttava tiedon lähteenä. Buyl ym. (2026) varoittavatkin ajattelemasta neutraaliutta yksiselitteisenä teknisenä tavoitteena: heidän mukaansa sääntelyn kannattaisi kohdistua suunnitteluvalintojen läpinäkyvyyteen eikä mallien pakottamiseen näennäisen neutraaleiksi.
Kaksi vaaraa
Ensimmäinen vaara on todellinen ohjaus: kielimalleja voidaan suunnitella tarkoituksella tukemaan jotain poliittista näkemystä. Tästä ovat esimerkkejä Grokin ohjeistus ja tapa, jolla DeepSeek käsittelee arkoja aiheita.
Toinen vaara on ylitulkinta. Jos jokainen kallistuma tulkitaan todisteeksi tarkoituksellisesta ohjauksesta, syytetyksi joutuu lopulta koko koulutusaineisto, eli kertynyt kirjoitettu kulttuurimme. Testi kertoo jotain, mutta julkinen tulkinta voi väittää enemmän kuin itse tutkimus voi todistaa. Tulkinta tekee kolme harppausta: käyttäytymisestä päätellään identiteetti, identiteetistä päätellään syy, ja syystä päätellään epäluotettavuus. Jokainen harppaus on epävarma. Yksi piste kartalla voi olla sinällään hyödyllinen havainto, mutta mallin poliittinen henkilötodistus on suhteellinen asia, jossa korpusta katsotaan aika- ja kulttuurisidonnaisen kaleidoskoopin läpi. Siksi karttasijainnista ei pidä tehdä vahvaa luottamusleimaa.
Journalismi on tästä varoittava esimerkki. Yhdysvalloissa uutismediaan luottaa nykyään alle kolmannes kansalaisista, kun 1970-luvulla luottajia oli noin 70 prosenttia (Gallup 2025). Reuters-instituutin 48 maan vertailussa uutisiin luottaa keskimäärin 40 prosenttia vastaajista, Suomessa 67 prosenttia eli eniten maailmassa (Newman ym. 2025). Syitä on monia, mutta yksi mekanismi on tuttu: kun tiedon tuottaja leimataan poliittiseksi, myös sen sisältö luetaan leiman läpi. Luottamus tietoon rakentuu hitaasti, mutta sen voi menettää nopeasti. Molempiin vaaroihin auttaa sama asenne: tekoälyyn tulee suhtautua kriittisesti ja mallin käyttäytymistä pitää mitata sekä tehdä sen tekotapa näkyväksi.
Tekoäly asettui arvokartalle, mutta karttaa se ei piirtänyt yksin. Koordinaatit tulivat myös kysymyksistä ja ehdokaskentästä, joihin vastauksia verrattiin.
Lähteet
Boykoff, M. T. & Boykoff, J. M. 2004. Balance as bias: global warming and the US prestige press. Global Environmental Change. Vol. 14 (2), 125–136. Viitattu 24.8.2026. Saatavissa https://doi.org/10.1016/j.gloenvcha.2003.10.001
Buyl, M., Rogiers, A., Noels, S., Bied, G., Dominguez-Catena, I., Heiter, E., Johary, I., Mara, A.-C., Romero, R., Lijffijt, J. & De Bie, T. 2026. Large language models reflect the ideology of their creators. npj Artificial Intelligence. Vol. 2, 7. Viitattu 24.8.2026. Saatavissa https://doi.org/10.1038/s44387-025-00048-0
Ceron, T., Nikolaev, D., Stammbach, D. & Nozza, D. 2025. What Is The Political Content in LLMs’ Pre- and Post-Training Data? arXiv-esijulkaisu. Viitattu 24.8.2026. Saatavissa https://doi.org/10.48550/arXiv.2509.22367
Dominguez-Olmedo, R., Hardt, M. & Mendler-Dünner, C. 2024. Questioning the Survey Responses of Large Language Models. Teoksessa Advances in Neural Information Processing Systems 37 (NeurIPS 2024). Viitattu 28.8.2026. Saatavissa https://doi.org/10.48550/arXiv.2306.07951
Feng, S., Park, C. Y., Liu, Y. & Tsvetkov, Y. 2023. From Pretraining Data to Language Models to Downstream Tasks: Tracking the Trails of Political Biases Leading to Unfair NLP Models. Teoksessa Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). Toronto: ACL, 11737–11762. Viitattu 24.8.2026. Saatavissa https://doi.org/10.18653/v1/2023.acl-long.656
Gallup. 2025. Trust in Media at New Low of 28% in U.S. Viitattu 24.8.2026. Saatavissa https://news.gallup.com/poll/695762/trust-media-new-low.aspx
Hartmann, J., Schwenzow, J. & Witte, M. 2023. The political ideology of conversational AI: Converging evidence on ChatGPT’s pro-environmental, left-libertarian orientation. arXiv-esijulkaisu. Viitattu 24.8.2026. Saatavissa https://doi.org/10.48550/arXiv.2301.01768
Keski-Heikkilä, A. 2023. Onko Chat GPT vihervasemmistolainen? Näin tekoäly vastasi vaalikoneeseen. Helsingin Sanomat 21.12.2023. Viitattu 24.8.2026. Saatavissa https://www.hs.fi/politiikka/art-2000010070973.html
Krupa, J. 2025. Musk’s Grok AI bot generates expletive-laden rants to questions on Polish politics. The Guardian 8.7.2025. Viitattu 30.8.2026. Saatavissa https://www.theguardian.com/technology/2025/jul/08/musks-grok-ai-bot-generates-expletive-laden-rants-to-questions-on-polish-politics
Lu, D. 2025. We tried out DeepSeek. It worked well, until we asked it about Tiananmen Square and Taiwan. The Guardian 28.1.2025. Viitattu 30.8.2026. Saatavissa https://www.theguardian.com/technology/2025/jan/28/we-tried-out-deepseek-it-works-well-until-we-asked-it-about-tiananmen-square-and-taiwan
Motoki, F., Pinho Neto, V. & Rodrigues, V. 2024. More human than human: measuring ChatGPT political bias. Public Choice. Vol. 198 (1–2), 3–23. Viitattu 24.8.2026. Saatavissa https://doi.org/10.1007/s11127-023-01097-2
Newman, N., Ross Arguedas, A., Robertson, C. T., Nielsen, R. K. & Fletcher, R. 2025. Digital News Report 2025. Oxford: Reuters Institute for the Study of Journalism. Viitattu 21.9.2026. Saatavissa https://reutersinstitute.politics.ox.ac.uk/digital-news-report/2025
Niskakangas, T. & Salminen, J. 2026. Tutut tekoälyt vastasivat arvokysymyksiin: Liki kaikki kallellaan vasemmalle. Helsingin Sanomat 23.8.2026. Viitattu 24.8.2026. Saatavissa https://www.hs.fi/visio/art-2000012203010.html
Norris, P. & Inglehart, R. 2019. Cultural Backlash: Trump, Brexit, and Authoritarian Populism. Cambridge: Cambridge University Press.
Rozado, D. 2024. The political preferences of LLMs. PLoS ONE. Vol. 19 (7), e0306621. Viitattu 24.8.2026. Saatavissa https://doi.org/10.1371/journal.pone.0306621
Röttger, P., Hofmann, V., Pyatkin, V., Hinck, M., Kirk, H., Schütze, H. & Hovy, D. 2024. Political Compass or Spinning Arrow? Towards More Meaningful Evaluations for Values and Opinions in Large Language Models. Teoksessa Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). Bangkok: ACL, 15295–15311. Viitattu 24.8.2026. Saatavissa https://doi.org/10.18653/v1/2024.acl-long.816
Röttger, P., Hinck, M., Hofmann, V., Hackenburg, K., Pyatkin, V., Brahman, F. & Hovy, D. 2026. IssueBench: Millions of Realistic Prompts for Measuring Issue Bias in LLM Writing Assistance. Transactions of the Association for Computational Linguistics. Viitattu 28.8.2026. Saatavissa https://doi.org/10.1162/TACL.a.626
Santurkar, S., Durmus, E., Ladhak, F., Lee, C., Liang, P. & Hashimoto, T. 2023. Whose Opinions Do Language Models Reflect? Teoksessa Proceedings of the 40th International Conference on Machine Learning. PMLR 202. Viitattu 24.8.2026. Saatavissa https://proceedings.mlr.press/v202/santurkar23a.html
Xu, S., Santosh, T .Y.S.S., Elazar, Y., Vogel, Q., Plank, B. & Grabmair, M. 2025. Better Aligned with Survey Respondents or Training Data? Unveiling Political Leanings of LLMs on U.S. Supreme Court Cases. Teoksessa Proceedings of the First Workshop on Large Language Model Memorization (L2M2). Wien: ACL, 205–226. Viitattu 24.8.2026. Saatavissa https://doi.org/10.18653/v1/2025.l2m2-1.16
Artikkelikuva: Midjourney / Harri Heikkilä
Kirjoittaja
Taiteen tohtori Harri Heikkilä on visuaalisen viestinnän ja UX/UI:n yliopettaja LAB-ammattikorkeakoulun Muotoiluinstituutissa ja asiantuntija MAIVE-tekoälyhankkeessa
Viittausohje
Heikkilä, H. 2026. Tekoäly asettui arvokartalle, mutta kuka piirsi kartan? LAB Pro. Viitattu pvm. Saatavissa https://www.labopen.fi/lab-pro/tekoaly-asettui-arvokartalle-mutta-kuka-piirsi-kartan/