یک مقاله علمی میتواند تنها به دلیل اینکه به شیوهای متفاوت نوشته شده است، نمره بالاتری بگیرد، در حالی که دقیقاً همان نتایج را بیان میکند؟ این سوال در مرکز یک مطالعه است که توسط مینگ لی و هفت نویسنده دیگر نوشته شده و در تاریخ 10 اوت 2026 منتشر شده است. این مطالعه مفهومی به شدت فنی و نگرانکننده را به بحث علمی معرفی میکند: تأثیر بلاغی ارزیابی هوش مصنوعی در فرآیندهای بازبینی همتا بهصورت خودکار. این تحقیق نشان میدهد که مدلهای زبانی بزرگ که برای قضاوت مقالات علمی فراخوانده میشوند، میتوانند تحت تأثیر سبک ارائه متن قرار بگیرند، حتی زمانی که محتوای علمی یکسان باقی بماند.
خلاصه
تیم تحقیق یک آزمایش طراحی کرده است که بهمنظور ایزوله کردن یک متغیر واحد: فرم، نه محتوا. با شروع از 120 ارسال ناشناس ارائهشده به ICLR 2026، یکی از کنفرانسهای مهم در زمینه یادگیری ماشین، نویسندگان یک مجموعه کنترلشده از 4200 مقاله کامل تولید کردند که همگی از همان کارهای اصلی مشتق شدهاند اما با توجه به واریانتهای بلاغی متفاوت بازنویسی شدهاند.
دو بازنویسنده مبتنی بر مدلهای زبانی بزرگ بر روی شش بعد بلاغی متمایز کار کردند و آنها را به سمتهای مخالف برای هر مقاله تغییر دادند: از یک سو نسخههایی که بر جنبههای خاصی از اقناع تأکید میکردند و از سوی دیگر نسخههایی که آنها را تضعیف میکردند، در حالی که نتایج علمی گزارششده را دست نخورده نگه میداشتند. در این مرحله، پنج بازبینیکننده هوش مصنوعی وارد عمل شدند که موظف به ارزیابی مقالات تحت دو پروتکل متمایز، یکی استاندارد و دیگری سختگیرانهتر بودند و همچنین پیکربندیهای بازنویسی مشترک، تکراری و هدایتشده توسط خود بازبینیکننده را آزمایش کردند.
نتیجهای که بیشترین اهمیت را دارد این است که حساسیت بلاغی یکنواخت نیست، بلکه بر اساس یک سلسلهمراتب واقعی ساختار یافته است. از میان شش بعد آزمایش شده، چارچوب شواهد و موضع در مورد نوآوری کار، بزرگترین تضادها را بین نسخههای بازنویسی شده به صورت مثبت و نسخههای بازنویسی شده به صورت منفی تولید میکنند. چارچوب هدف تحقیق یک سطح دوم، ضعیفتر اما هنوز قابل درک، را تشکیل میدهد، در حالی که سایر ابعاد بلاغی اثرات کمتری یا کمتر پایداری را نشان میدهند.
این سلسلهمراتب همچنین با مقایسه دستنوشتههای با کیفیتهای متفاوت که توسط بازبینهای انسانی ارزیابی شدهاند، حفظ میشود. اما یک جزئیات وجود دارد که پدیده را حتی حساستر میکند: حرکت نمرات به شدت به نمره اولیهای که توسط بازبین AI اختصاص داده شده است، وابسته است. دستنوشتههایی که با نمرات پایینتر شروع میشدند، پس از بازنویسی بلاغی تمایل به بالا رفتن داشتند، در حالی که آنهایی که نمرات بالایی داشتند، تمایل به پایین آمدن داشتند. تضادهای جهتدار واضحتر در نمرات میانرده مشاهده میشود، جایی که تصمیمات ویرایشی بیشتر نامشخص و بنابراین بیشتر تحت تأثیر قرار میگیرند.
یکی از جنبههای غیرقابل پیشبینی مطالعه مربوط به اثربخشی روشهای دستکاری بلاغی پیچیدهتر است. جریانهای کار پیچیدهتر، که بازنویسی مشترک، بازگشتی یا هدایت شده توسط بازبین را ترکیب میکنند، به طور قابل اعتمادی سود بیشتری نسبت به مداخلات سادهتر تولید نمیکنند. به عبارت دیگر، افزودن پیچیدگی به فرآیند بازنویسی به طور خودکار به معنای دستکاری بهتر قضاوت AI نیست.
اثرات بازنویسی مشترک به شدت به مدلی که به عنوان بازنویس استفاده میشود وابسته است: تغییر مدل زبان بزرگ به طور قابل توجهی نتیجه را تغییر میدهد. حتی ارائه دستورالعملهای صریح به بازبین AI نیز مزیت ثابتی نسبت به یک خوانش ساده دوم بدون هدایت نشان نداد. همچنین، بازنویسی مکرر، بازدههای کاهشی و به شدت وابسته به پیکربندی خاص استفاده شده تولید میکند. با این حال، مطالعه یک تقسیم نقش نسبتاً واضح را شناسایی میکند: مدل بازنویس عمدتاً جدایی بین انواع متضاد را تعیین میکند، در حالی که مدل بازبین میزان و علامت اثر بر نمره را تعیین میکند.
زمانی که محققان پروتکل بازبینی سختگیرانهتری را اعمال کردند، نمره میانگین ارزیابی کلی به میزان ۱.۳۶ امتیاز نسبت به پروتکل استاندارد کاهش یافت. اما اینجا دادهای وجود دارد که برای طراحان این سیستمها بیشتر اهمیت دارد: شدت بیشتر به طور مداوم حساسیت بلاغی بازبینهای AI را کاهش نداده است. به عبارت دیگر، سختگیرتر کردن قاضی به طور خودکار او را در برابر انتخابهای سبک متن که در حال ارزیابی است، مصون نمیکند.
چرا این همه اهمیت دارد؟ زیرا بازبینی علمی تحت فشار فزایندهای قرار دارد. حجم انتشارات به سرعتهای نمایی در حال افزایش است و جذب بازبینهای انسانی در دسترس به طور فزایندهای دشوار شده است، به طوری که طبق یک نظرسنجی انجام شده در میان کارکنان مجلات Frontiers، بیش از نیمی از بازبینها به نوعی از هوش مصنوعی در فرآیند ارزیابی خود استفاده میکنند. در این زمینه، ایدهای که سیستمهای خودکار میتوانند با ترفندهای بلاغی ساده دستکاری شوند، بدون اینکه محتوای علمی را تغییر دهند، شکاف بالقوه جدی در یکپارچگی فرآیند ایجاد میکند.
نویسندگان این مطالعه تنها به مستندسازی مشکل نمیپردازند: آنها آن را به عنوان نوعی reward hacking معرفی میکنند، یعنی بهرهبرداری از میانبرهای زبانی برای کسب نمره بهتر بدون اینکه واقعاً کیفیت کار را بهبود بخشند. نتیجهای که از این میگیرد واضح است: به سیستمهای ارزیابی خودکار نیاز است که قادر به مقاومت در برابر تغییرات بلاغی باشند که محتوای علمی را تغییر نمیدهند. تا زمانی که این استحکام تضمین نشود، هر خط اضافه یا بازنویسی شده ممکن است بیشتر از دادههایی که یک مقاله علمی واقعاً باید منتقل کند، وزن داشته باشد.
انتخابهای بلاغی مانند چارچوببندی شواهد و موضعگیری در مورد نوآوری به طور قابل توجهی بر قضاوتهای بازبینهای هوش مصنوعی تأثیر میگذارد، حتی زمانی که محتوای علمی یکسان باقی بماند.
یک مجموعه کنترل شده از ۴۲۰۰ دستنوشته، مشتق شده از ۱۲۰ ارسال ناشناس ارائه شده به ICLR ۲۰۲۶، استفاده شده است.
خیر: جریانهای کار بازنویسی پیچیدهتر به طور قابل اعتمادی نمرات بالاتری نسبت به مداخلات سادهتر تولید نکردهاند.
پروتکل بازبینی سختگیرانه میانگین نمره ارزیابی کلی را ۱.۳۶ امتیاز کاهش داد، اما به طور مداوم حساسیت بلاغی بازبینهای هوش مصنوعی را تغییر نداد.
محتوا با کمک هوش مصنوعی و با بازبینی ویرایشی انسانی تهیه شده است.
این محتوا صرفاً برای اطلاعرسانی عمومی ارائه شده است و بهمنزله مشاوره مالی، سرمایهگذاری، حقوقی یا مالیاتی تلقی نمیشود. هرگونه رویداد، جایزه، کمپین آنلاین یا اطلاعات مرتبط که در اینجا ذکر شده است، نباید بهعنوان توصیه، ترغیب یا دعوت به خرید، فروش، معامله یا هرگونه دادوستد دیگر داراییهای رمزارزی تلقی شود. داراییهای رمزارزی از نوسان بالایی برخوردار هستند و ممکن است منجر به زیان شوند. دسترسی به خدمات، محصولات و رویدادهای مرتبط با WEEX ممکن است بسته به منطقه جغرافیایی متفاوت باشد. اطمینان از اینکه استفاده شما از این خدمات با قوانین و مقررات محلی مطابقت دارد، بر عهده خود شماست.





























