ChatGPT, Claude, Copilot, Grok ja Gemini olivat väärässä keskimäärin 57 % ajasta. Tutkimuksessa kielimallit saivat vastata sataan raha-aiheiseen kysymykseen enintään viidesti. Tutkimus käsitti yli 10000 kysymystä ja 18 mallia.
Teknologiayritys Saturnin tutkimus kysyi myös monimutkaisempia kysymyksiä, jotka sisälsivät enemmän kuin yhden laskutoimituksen, ja virheiden määrä nousi 88 prosenttiin. Jotkut mallit olivat väärässä jopa 99 % ajasta. Mallien virheet vaihtelivat virheissä laskutoimituksissa keksittyihin sääntöihin.
Ote artikkelista: Report finds some chatbots ignored upcoming tax changes and hallucinated rules