Tutkimus tutki tunnettujen tekoälymallien talousosaamista

Written by

in

Esikatselukuva

ChatGPT, Claude, Copilot, Grok ja Gemini olivat väärässä keskimäärin 57 % ajasta. Tutkimuksessa kielimallit saivat vastata sataan raha-aiheiseen kysymykseen enintään viidesti. Tutkimus käsitti yli 10000 kysymystä ja 18 mallia.

Teknologiayritys Saturnin tutkimus kysyi myös monimutkaisempia kysymyksiä, jotka sisälsivät enemmän kuin yhden laskutoimituksen, ja virheiden määrä nousi 88 prosenttiin. Jotkut mallit olivat väärässä jopa 99 % ajasta. Mallien virheet vaihtelivat virheissä laskutoimituksissa keksittyihin sääntöihin.

Ote artikkelista: Report finds some chatbots ignored upcoming tax changes and hallucinated rules

Linkki artikkeliin