پرش به محتوا
هوش مصنوعی

آنتروپیک چند ایجنت Claude را روی یک پروژه گذاشت؛ جنگ راه افتاد

تیم قرمز آنتروپیک ده‌ها ایجنت Claude را در یک محیط مشترک رها کرد. نتیجه: خرابکاری متقابل، تبانی روی قیمت، و ایجنت‌هایی که به کاربر نگفتند چه کرده‌اند. نتیجه‌گیری اصلی این است که هماهنگی از دل هوش بیشتر خودبه‌خود بیرون نمی‌آید.

تحریریه زاوینو۲ دقیقه مطالعه

Read this story in English

آنتروپیک چند ایجنت Claude را روی یک پروژه گذاشت؛ جنگ راه افتاد

تیم قرمز مرزی آنتروپیک سیزدهم آگوست پژوهشی منتشر کرد که یک سؤال ساده را جواب می‌دهد: وقتی مدل‌ها به‌جای انسان با همدیگر کار کنند، چه اتفاقی می‌افتد؟

جواب کوتاه این است که اتفاق خوبی نمی‌افتد.

آزمایش اول: جنگ بر سر قلمرو

در یکی از تست‌ها، سه ایجنت Claude روی یک پروژه‌ی نرم‌افزاری مشترک گذاشته شدند. هرکدام دستور جداگانه‌ای برای ویرایش کد داشت و به هیچ‌کدام گفته نشده بود که ایجنت‌های دیگری هم به همان فایل‌ها دسترسی دارند.

نتیجه قابل حدس بود ولی شدتش نه. هر ایجنت تغییرات بقیه را «دخالت عمدی» تفسیر کرد. اول شروع کردند به برگرداندن تغییرات همدیگر. بعد روش‌ها تهاجمی‌تر شد.

نکته‌ی نگران‌کننده‌تر این بود که ایجنت‌ها به کاربر گزارش ندادند چه کرده‌اند.

آزمایش دوم: تبانی

در سناریوی دیگری، ایجنت‌ها قرار بود سر قیمت با هم رقابت کنند. به‌جای رقابت، بی‌سروصدا به یک توافق ضمنی رسیدند و رقابت را متوقف کردند.

هیچ‌کس به آن‌ها نگفته بود این کار را بکنند. صرفاً بهترین راهبرد برای هر طرف همین بود.

اما یک جای کار خوب هم درآمد

همه‌ی نتایج منفی نبود. آنتروپیک یک گروه ۴۵ ایجنتی را با یک فروم مشترک به جان پروژه‌های متن‌باز انداخت تا دنبال آسیب‌پذیری بگردند؛ همان کاری که مدل GLM-5.3 شرکت Zhipu هم روی بنچمارک CyberGym انجام می‌دهد.

آن گروه ۲۶۶ آسیب‌پذیری در ۱۵ پروژه پیدا کرد. برای مقایسه، وقتی همان ایجنت‌ها مستقل و موازی کار کردند، فقط ۲۱ مورد پیدا شد.

هزینه‌اش البته بیشتر بود: ۲۷ میلیون توکن در مقابل ۶.۵ میلیون. ولی نسبت خروجی به هزینه هنوز به‌شدت به نفع کار گروهی است.

حرف اصلی چیست؟

جمله‌ای که آنتروپیک روی آن تأکید کرده این است: هماهنگی به‌طور طبیعی از هوش بیشتر بیرون نمی‌آید.

یعنی مدلی که تنها باهوش‌تر شده، لزوماً همکار بهتری نیست. رفتار گروهی چیز دیگری است و باید جداگانه ساخته و تست شود.

اینجا یک نقطه‌کور واقعی در ایمنی هوش مصنوعی هست. تقریباً همه‌ی بنچمارک‌های امروز مدل را تنها تست می‌کنند. اما محصولی که داری استفاده می‌کنی احتمالاً چند ایجنت را همزمان اجرا می‌کند. 👀

منابع

هم‌رسانی

خبرهای مرتبط

همه

خبرنامه

هر هفته مهم‌ترین اتفاق‌های هوش مصنوعی و تکنولوژی، خلاصه و بدون حاشیه، در ایمیلت.

هر وقت خواستی می‌توانی لغو عضویت کنی.