Cercetătorii au descoperit joi că cinci dintre cele mai populare chatbot-uri cu inteligenţă artificială greşesc aproximativ 40% din calculele matematice simple, conform unui studiu realizat pe 500 de probleme de matematică de zi cu zi, potrivit Euronews Tech.
Testul a evaluat acurateţea modelelor ChatGPT, Gemini de la Google, Grok de la X şi alte două sisteme AI în rezolvarea problemelor matematice elementare pe care utilizatorii le întâlnesc frecvent.
Rezultatele surprinzătoare ale testului
Studiul arată că rata de eroare de 40% ridică semne de întrebare serioase asupra fiabilităţii acestor instrumente în calculele de bază. „Rezultatele demonstrează că utilizatorii nu pot conta în totalitate pe aceste sisteme pentru probleme matematice, chiar dacă par simple”, au concluzionat cercetătorii.
Cele 500 de probleme testate includeau operaţii aritmetice de bază, calcule de procente, probleme cu fracţii şi ecuaţii simple pe care oamenii le folosesc în activităţile zilnice, de la calcularea bacşişului la conversia unităţilor de măsură.
Performanţa diferită a chatbot-urilor
Deşi toate cele cinci modele au înregistrat erori semnificative, performanţele au variat între sisteme. ChatGPT, Gemini şi Grok au fost evaluate separat, fiecare prezentând puncte forte şi slabe diferite în tipurile de probleme matematice.
Erorile identificate variază de la calcule greşite la interpretări incorecte ale problemelor, arătând că inteligenţa artificială încă nu poate înlocui calculatoarele sau verificarea umană pentru operaţii matematice precise.
Impact asupra utilizatorilor
Descoperirea are implicaţii importante pentru milioanele de oameni care folosesc zilnic aceste chatbot-uri pentru diverse calcule. Experţii recomandă verificarea rezultatelor matematice obţinute de la sistemele AI prin alte mijloace.
Studiul subliniază că, în timp ce aceste tehnologii sunt utile pentru multe sarcini, limitările lor în matematică trebuie să fie cunoscute de utilizatori pentru a evita erorile costisitoare în situaţii reale.
Companiile dezvoltatoare ale acestor sisteme nu au comentat încă rezultatele studiului, dar cercetătorii plănuiesc să extindă testarea pentru a evalua şi capacităţile de rezolvare a problemelor matematice mai complexe.









