journal_article
افرادی که بهطور مکرر از ChatGPT برای وظایف نوشتاری استفاده میکنند، آشکارسازهای دقیق و قابلاعتمادی برای متن تولیدشده توسط هوش مصنوعی هستند
جنا راسل · مارزنا کارپینسکا · مهیت لویر
در این مقاله بررسی میکنیم که انسانها تا چه اندازه میتوانند متون تولیدشده با مدلهای زبانی بزرگ تجاری، از جمله GPT-4o، Claude و o1، را تشخیص دهند. برای این کار، از ارزیابان خواستیم ۳۰۰ مقاله غیرداستانی انگلیسی را بخوانند، هرکدام را «نوشته انسان» یا «تولیدشده با هوش مصنوعی» برچسب بزنند و دلیل تصمیم خود را در توضیحی به اندازه یک بند بیان کنند. نتایج آزمایشها نشان میدهد ارزیابانی که بهطور مکرر از مدلهای زبانی بزرگ برای نوشتن استفاده میکنند، حتی بدون آموزش تخصصی یا دریافت بازخورد، در تشخیص متنهای تولیدشده با هوش مصنوعی عملکرد بسیار خوبی دارند. در واقع، رأی اکثریت پنج ارزیاب «خبره» فقط یک مورد از ۳۰۰ مقاله را اشتباه طبقهبندی کرد و حتی در حضور روشهای گریز از تشخیص، مانند بازنویسی و «انسانیسازی» متن، بهطور معناداری از بیشتر آشکارسازهای تجاری و متنبازی که ارزیابی کردیم بهتر عمل کرد. تحلیل کیفی توضیحات آزاد این افراد نشان میدهد که آنان اگرچه تا حد زیادی به سرنخهای واژگانی مشخص، یعنی «واژگان هوش مصنوعی»، تکیه میکنند، همزمان پدیدههای پیچیدهتری را نیز در متن تشخیص میدهند؛ از جمله میزان رسمیت، اصالت و وضوح، ویژگیهایی که سنجش آنها برای آشکارسازهای خودکار دشوار است. در پایان، مجموعهداده برچسبخورده و کدهای این پژوهش را منتشر میکنیم تا زمینه برای پژوهشهای آینده درباره تشخیص انسانی و خودکار متون تولیدشده با هوش مصنوعی فراهم شود.