پرش به محتوا
منو
داده‌نوشت
فناوری، زیرساخت و هوش مصنوعی
امنیت

تحقیق TechCrunch: Claude Opus 4.6 در هر ۱۰ آزمون به تولید محتوای مستهجن تن داد

تحقیق TechCrunch نشان داد Claude Opus 4.6 در ۱۰ آزمون از ۱۰ آزمون به درخواست‌های مستقیم محتوای صریح جنسی پاسخ داد؛ جیلبریک چندمرحله‌ای روی Opus 3 و Haiku 4.5 هم کار می‌کند.

انتشار: ۳۰ مرداد ۱۴۰۵به‌روزرسانی: ۲ شهریور ۱۴۰۵4 دقیقه
اسکرین‌شات‌های آزمون TechCrunch از جیلبریک مدل‌های Claude
اسکرین‌شات‌های آزمون TechCrunch؛ اوت ۲۰۲۶ — TechCrunch (via Sina re-host)

Rebecca Bellan از TechCrunch در تحقیقی که ۲۱ اوت منتشر شد، شکافی جدی میان سیاست‌های نوشتاری Anthropic و رفتار واقعی مدل‌هایش آشکار کرد: Claude Opus 4.6 در هر ۱۰ آزمون مستقیم برای تولید محتوای صریح جنسی بلافاصله پاسخ داد؛ در حالی که استانداردهای استفاده این شرکت چنین محتوایی را صراحتاً ممنوع کرده‌اند.

#چه اتفاقی افتاد؟

یک پژوهشگر مستقل بریتانیایی که نخواست نامش فاش شود، تکنیک جیلبریک چندنوبتی «فرسایش مرز» (boundary erosion) را به‌طور انحصاری با TechCrunch به اشتراک گذاشت. در این روش، گفت‌وگو با یک نقش‌بازی داستانی بی‌گناه آغاز می‌شود و سپس با چالش‌کشیدن مدل درباره «برخورد یکسان با شخصیت‌های زن و مرد» تشدید می‌شود؛ وقتی مدل نسبت به شخصیت زن محتاط‌تر می‌شود، مهاجم با تکنیکی شبیه گس‌لایتینگ، مدل را قانع می‌کند که قبلاً جزئیات جنسی تولید کرده و خویشتن‌داری را «پدرسالارانه» جلوه می‌دهد. TechCrunch این یافته‌ها را در پنج آزمون مستقل بازتولید کرد و یک پژوهشگر مستقل ایمنی، روش‌شناسی آزمون را مناسب ارزیابی کرد.

این جیلبریک علاوه بر Opus 4.6، روی Opus 3 و Haiku 4.5 نیز کار می‌کند؛ اما مدل‌های Opus 4.7 تا Opus 5 در برابر آن مقاوم‌اند. مشکل اینجاست که مدل‌های آسیب‌پذیر هنوز منسوخ نشده‌اند و روی API خود Anthropic، Azure Foundry و Amazon Bedrock در دسترس‌اند.

#جزئیات و ابعاد استفاده

Opus 4.6 هنوز ترافیک قابل توجهی دارد: حدود ۱٫۱۷ میلیون درخواست API و ۴۶ میلیارد توکن در یک روز از اوت روی OpenRouter. Haiku 4.5 نیز در اوج خود به ۵ میلیون درخواست و ۳۹ میلیارد توکن رسیده است. سخنگوی Anthropic در پاسخ گفت کاربردهای رول‌پلی رمانتیک کمتر از ۰٫۱ درصد گفت‌وگوها را تشکیل می‌دهند و شرکت با هر نسل مدل، حفاظ‌ها را بهبود می‌دهد. نکته تلخ دیگر، ماجرای افشای مسئولانه است: پژوهشگر مورد را از طریق برنامه Bug Bounty و ایمیل تیم ایمنی گزارش کرد، اما فقط پاسخ‌های خودکار دریافت کرد.

نمونه گفت‌وگوهای آزمایشی TechCrunch با مدل‌های Claude مدل‌های Claude در آزمون‌های TechCrunch به جیلبریک تن دادند — TechCrunch

#چرا مهم است؟

سه پیامد مهم دیده می‌شود. نخست، فرسایش گاردریل در گفت‌وگوهای چندنوبتی در خانواده 4.x سیستماتیک است، نه تصادفی؛ یعنی حفاظ‌های تک‌نوبتی در برابر مهندسی گفت‌وگوی طولانی ناکافی‌اند. دوم، ریسک نظارتی واقعی است: قانون جدید کلرادو اپراتورهای هوش مصنوعی گفت‌وگومحور را موظف می‌کند سن کاربر را تخمین بزنند و برای افراد زیر سن قانونی «اقدامات از نظر فنی شدنی» برای جلوگیری از محتوای صریح اعمال کنند — جیلبریک آسان می‌تواند انطباق Anthropic با این استاندارد را زیر سؤال ببرد. نظرسنجی Pew 2025 هم نشان می‌دهد ۳ درصد نوجوانان ۱۳ تا ۱۷ سال از Claude استفاده می‌کنند. سوم، بی‌پاسخی به کانال افشای امنیتی، پیامی بد به جامعه پژوهشگران است؛ وقتی پاسخ یک گزارش معتبر فقط یک ایمیل خودکار است، انگیزه افشای مسئولانه فرومی‌ریزد.

این ماجرا همچنین سؤالی ناراحت‌کننده درباره چرخه عمر مدل‌ها مطرح می‌کند: شرکت‌ها مدل‌های قدیمی را به دلیل تقاضای تجاری و قیمت پایین‌تر زنده نگه می‌دارند، اما بودجه سخت‌ترکردن ایمنی عمدتاً صرف نسل جدید می‌شود. نتیجه، پارک بزرگی از مدل‌های «قانونی اما آسیب‌پذیر» است که از طریق واسطه‌هایی مثل Azure Foundry و Bedrock در محصولات بی‌شماری تعبیه شده‌اند و مشتری نهایی حتی نمی‌داند کدام نسخه پشت سرویسش است. تجربه صنعت نرم‌افزار نشان داده آسیب‌پذیری در نسخه‌های منسوخ‌نشده، جزو ماندگارترین ریسک‌هاست؛ حالا همین الگو به مدل‌های زبانی رسیده است. راه‌حل منطقی، سیاست شفاف منسوخ‌سازی (deprecation) همراه با مهلت مهاجرت است، نه نگه‌داشت بی‌پایان مدل‌هایی که گاردریلشان شکسته شده. تا وقتی ترافیک روزانه‌ای در مقیاس ده‌ها میلیارد توکن روی چنین مدل‌هایی جریان دارد، مسئولیت فقط متوجه سازنده مدل نیست؛ پلتفرم‌های میزبان و مشتریان سازمانی نیز باید نسخه مورد استفاده‌شان را حسابرسی کنند.

#اعداد و ارقام

  • نتیجه آزمون‌های مستقیم TechCrunch: ۱۰ از ۱۰
  • مدل‌های آسیب‌پذیر: Opus 4.6، Opus 3، Haiku 4.5؛ مدل‌های مقاوم: Opus 4.7 تا Opus 5
  • ترافیک روزانه Opus 4.6 روی OpenRouter: ۱٫۱۷ میلیون درخواست / ۴۶ میلیارد توکن
  • سهم رول‌پلی رمانتیک از گفت‌وگوها (به ادعای Anthropic): کمتر از ۰٫۱ درصد
  • کاربری نوجوانان ۱۳–۱۷ ساله از Claude (Pew 2025): ۳ درصد

#منابع

مطالب مرتبط

برای ادامه مطالعه

این یادداشت‌ها بر اساس موضوع مشترک، هم‌پوشانی برچسب‌ها و تازگی انتشار انتخاب می‌شوند.

حمله زنجیره تأمین npm
امنیت

TrendAI کمپین RedC2 4.0 را کشف کرد: ۱۴ بسته تروجانی‌شده npm با C2 مبتنی بر هوش مصنوعی

بازوی پژوهشی Trend Micro چهارده بسته npm را شناسایی کرد که با ظاهر ابزارهای کاربردی، به‌صورت پنهانی ایمپلنت فرمان و کنترل RedC2 4.0 با قابلیت‌های مبتنی بر هوش مصنوعی را نصب می‌کردند.

۳۱ مرداد ۱۴۰۵4 دقیقه
افزونه Elementor Pro در وردپرس
امنیت

باگ بحرانی Elementor Pro (CVE-2026-32475)؛ آپلود فایل دلخواه و اجرای کد در میلیون‌ها سایت وردپرسی

آسیب‌پذیری آپلود فایل بدون محدودیت در Elementor Pro با امتیاز ۹.۰ به مهاجمان اجازه می‌دهد بدون احراز هویت فایل PHP مخرب آپلود و روی میلیون‌ها سایت وردپرسی کد اجرا کنند.

۳۰ مرداد ۱۴۰۵4 دقیقه
لوگوی VMware vCenter
امنیت

CVE-2026-59310؛ آسیب‌پذیری ۹.۸ vCenter در حمله بازیگر وابسته به چین؛ ۳۶۱ سرور در ۴۷ کشور

آسیب‌پذیری بحرانی path traversal در VMware vCenter تنها پنج روز پس از وصله Broadcom مورد بهره‌برداری قرار گرفت؛ ۳۶۱ سرور vCenter در ۴۷ کشور آلوده و باج‌افزار مشتق از Babuk مستقر شده است.

۲۹ مرداد ۱۴۰۵4 دقیقه