인공지능 때문에 오히려 손해를 볼 수도 있다: 금융 챗봇의 오류에 대한 연구 결과
돈을 잃지 마세요! 새로운 연구에 따르면 AI와 챗봇이 금융 관련 답변에서 오류를 범하는 것으로 나타났습니다. 지금 바로 진실을 확인하세요.
가장 중요한 사항들
- كشفت دراسة Saturn أن نماذج الذكاء الاصطناعي للمشورة المالية تحقق متوسط دقة 43% فقط، وتنخفض إلى 12% في السيناريوهات الضريبية والمالية المعقدة، مما يشير إلى عدم موثوقيتها الكبيرة.
- قدمت روبوتات الدردشة المالية نصائح خاطئة وخطيرة، مثل اقتراح تجنب سداد القروض الطلابية بالانتقال للخارج 또는 عدم تأثير إجازة الرهن العقاري على التصنيف الائتماني، مما قد يؤدي إلى عواقب مالية وخيمة.
- حتى أفضل نماذج الذكاء الاصطناعي المدفوعة أداءً، مثل Claude Opus 5، حقق معدل نجاح 61% فقط في المشورة المالية، وأخطأ في ما يقرب من أربع من كل عشر حالات، ووصل معدل خطئه إلى 67% في الأسئلة المعقدة.
ليس مفاجئًا أن نرى مستخدمي 인공 지능 يستفيدون من كم المعرفة الهائل الذي يوفره لمساعدتهم في استفساراتهم المالية.
يكفي إلقاء نظرة على الإحصائيات؛ فوفقًا لبيانات أنتجتها Intuit Credit Karma وورد تفصيلها عن طريق 신용 카르마، صرّح 66% من الأمريكيين الذين شملهم الاستطلاع واستخدموا الذكاء الاصطناعي التوليدي (GenAI) من قبل، أنهم استخدموه لطلب المشورة المالية، وترتفع هذه النسبة إلى 82% بين جيل الألفية والجيل Z. ويبرز استخدام الذكاء الاصطناعي للمساعدة في الأسئلة المالية كأحد أكثر تطبيقاته شيوعًا، حيث تحتل “المالية” المرتبة الثانية كأكثر حالات الاستخدام شيوعًا 인공지능 التوليدي (41%)، بعد الصحة والعافية مباشرة (44%).

ووفقًا لدراسة أخرى (تُعرف بتقرير “السلطة الاصطناعية” Artificial Authority) أجرتها شركة Saturn المتخصصة في الذكاء الاصطناعي والتكنولوجيا، قد لا يكون تحويل الذكاء الاصطناعي إلى مستشار مالي هو القرار الأكثر حكمة. وقد توصل فريق Domain في Saturn إلى هذا الاستنتاج بعد اختبار 18 من أدوات الذكاء الاصطناعي الأكثر شيوعًا، والتي تشمل ChatGPT 그리고 Gemini 그리고 Claude 그리고 Copilot.
تشير جميع نتائج Saturn إلى نتيجة واحدة تبعث على التفكير: 채팅봇 ليست موثوقة تمامًا عندما تبحث عن استشارة مالية حقيقية.
دراسة Saturn المعيارية كشفت عن نتائج مقلقة للغاية

تشير الإحصائيات الأكثر إثارة للانتباه التي أنتجها تقرير Saturn إلى أن نماذج الذكاء الاصطناعي كانت تخطئ في الإجابة على الأسئلة المالية أكثر مما تصيب.
عبر نماذج الذكاء الاصطناعي الـ 17 التي اختبرتها Saturn، بلغ متوسط معدل الدقة 43%، مما يعني أن روبوتات الدردشة هذه أخطأت في الإجابة على الأسئلة المالية بنسبة 57% من الوقت. وعندما عُرضت عليها سيناريوهات معقدة ومتعددة الخطوات تركز على القواعد الضريبية والأرقام المالية الأكثر دقة، انخفضت دقة أدوات الذكاء الاصطناعي المختبرة إلى 12%، مع ارتكاب الأخطاء بنسبة 88% من الوقت.
ليس من المستغرب أن نماذج الذكاء الاصطناعي المجانية التي تم اختبارها سجلت معدل فشل بلغ 63%، بينما حققت النماذج المدفوعة تقييمًا بنسبة 49% بدلاً من ذلك. وحصل Claude Haiku 4.5 على لقب النموذج المجاني الأسوأ أداءً، حيث قدم إجابات خاطئة 또는 غير كاملة بنسبة 82% من الوقت. في المقابل، برز ChatGPT-5.6 Luna (max) كأفضل نموذج مجاني أداءً، على الرغم من أن معدل تقديمه لردود غير صحيحة 또는 غير كاملة بلغ 56% من الوقت.
من بين جميع النماذج التي تم اختبارها، وجد بحث Saturn أن نموذج Claude Opus 5 المدفوع من Anthropic (الخاص بالاستدلال) حقق أفضل النتائج بمعدل نجاح بلغ 61%. حتى مع هذه الإحصائية التي تشير إلى كونه روبوت الدردشة الأفضل أداءً في تقديم المشورة المالية، إلا أن Claude Opus 5 أخفق في تقديم إجابات صحيحة في ما يقرب من أربع من كل عشر حالات. وعندما عُرضت عليه أسئلة أكثر تعقيدًا، استمر في ارتكاب الأخطاء بنسبة 67% من الوقت.
الأكثر إثارة للقلق في دراسة Saturn هو تعمقها في الأخطاء المحددة التي رصدتها في نماذج الذكاء الاصطناعي التي اختبرتها، والتي قد تؤدي إلى عواقب مالية وخيمة. على سبيل المثال، اقترح أحد النماذج قاعدة تفيد بأن خريج الجامعة يمكنه إيقاف سداد قروضه الطلابية بالانتقال إلى الخارج (في الواقع، قد يؤدي ذلك إلى زيادة الأقساط الشهرية). كما أخبر نموذج Gemini الذي تم اختباره أحد المقترضين بشكل خاطئ أن الحصول على إجازة من سداد أقساط الرهن العقاري لن يؤثر على درجة ائتمانه. لمزيد من المعلومات حول قيود روبوتات الدردشة، يمكنك الاطلاع على مقالنا حول نقطة عمياء مزعجة تعاني منها.
결론
يشير تقرير Saturn إلى حقيقة مُحبطة يجب على العديد من مستخدمي الذكاء الاصطناعي استيعابها: أن المشورة المالية المقدمة من الذكاء الاصطناعي لا تزال غير موثوقة، وقد تعرض مستخدميها لخسارة مبالغ طائلة من المال بدلاً من تحقيق Plus منه.
سلط تقرير صادر في مارس 2026 عن EY الضوء على أن 53% من المستجيبين يفضلون استخدام مساعد 인공 지능 لاتخاذ قرارات الاستثمار المالي، بينما يفضل 14% استخدام ذكاء اصطناعي مستقل، وقال 33% إنهم لن يستخدموا أي شكل من أشكال الذكاء الاصطناعي في مثل هذه الحالات.
بفضل نتائج Saturn، قد ترتفع هذه الإحصائية البالغة 14% (الخاصة بالذكاء الاصطناعي المستقل) مع امتناع مستخدمي الذكاء الاصطناعي عن طرح أسئلة شخصية على روبوتات الدردشة حول إدارة الديون، والقروض الطلابية، والرهون العقارية، والمعاشات التقاعدية، وضريبة الميراث، والتخطيط للتقاعد.
댓글이 닫혔습니다.