افرادی که به‌طور مکرر از ChatGPT برای وظایف نوشتاری استفاده می‌کنند، آشکارسازهای دقیق و قابل‌اعتمادی برای متن تولیدشده توسط هوش مصنوعی هستند

journal_article

افرادی که به‌طور مکرر از ChatGPT برای وظایف نوشتاری استفاده می‌کنند، آشکارسازهای دقیق و قابل‌اعتمادی برای متن تولیدشده توسط هوش مصنوعی هستند

جنا راسل · مارزنا کارپینسکا · مهیت لویر

در این مقاله بررسی می‌کنیم که انسان‌ها تا چه اندازه می‌توانند متون تولیدشده با مدل‌های زبانی بزرگ تجاری، از جمله GPT-4o، Claude و o1، را تشخیص دهند. برای این کار، از ارزیابان خواستیم ۳۰۰ مقاله غیرداستانی انگلیسی را بخوانند، هرکدام را «نوشته انسان» یا «تولیدشده با هوش مصنوعی» برچسب بزنند و دلیل تصمیم خود را در توضیحی به اندازه یک بند بیان کنند. نتایج آزمایش‌ها نشان می‌دهد ارزیابانی که به‌طور مکرر از مدل‌های زبانی بزرگ برای نوشتن استفاده می‌کنند، حتی بدون آموزش تخصصی یا دریافت بازخورد، در تشخیص متن‌های تولیدشده با هوش مصنوعی عملکرد بسیار خوبی دارند. در واقع، رأی اکثریت پنج ارزیاب «خبره» فقط یک مورد از ۳۰۰ مقاله را اشتباه طبقه‌بندی کرد و حتی در حضور روش‌های گریز از تشخیص، مانند بازنویسی و «انسانی‌سازی» متن، به‌طور معناداری از بیشتر آشکارسازهای تجاری و متن‌بازی که ارزیابی کردیم بهتر عمل کرد. تحلیل کیفی توضیحات آزاد این افراد نشان می‌دهد که آنان اگرچه تا حد زیادی به سرنخ‌های واژگانی مشخص، یعنی «واژگان هوش مصنوعی»، تکیه می‌کنند، هم‌زمان پدیده‌های پیچیده‌تری را نیز در متن تشخیص می‌دهند؛ از جمله میزان رسمیت، اصالت و وضوح، ویژگی‌هایی که سنجش آن‌ها برای آشکارسازهای خودکار دشوار است. در پایان، مجموعه‌داده برچسب‌خورده و کدهای این پژوهش را منتشر می‌کنیم تا زمینه برای پژوهش‌های آینده درباره تشخیص انسانی و خودکار متون تولیدشده با هوش مصنوعی فراهم شود.