معیار شخصی من برای هوش مصنوعی: یک SVG از قورباغه با فک هابسبورگ بساز
یک توسعهدهنده روش خلاقانهای برای آزمایش مدلهای هوش مصنوعی ابداع کرده است: از آنها میخواهد یک تصویر SVG از قورباغهای با فک معروف هابسبورگ بسازند. این آزمون در هکر نیوز با ۱۳۲ امتیاز و ۶۴ نظر مورد توجه قرار گرفت. این معیار جالب تفاوتهای میان سیستمهای مختلف هوش مصنوعی را در ترکیب تولید تصویر و دانش تاریخی آشکار میکند.
وقتی صحبت از ارزیابی مدلهای هوش مصنوعی میشود، اکثر توسعهدهندگان به آزمونهای استاندارد متکی هستند که تواناییهایی مثل استدلال ریاضی یا درک زبان را میسنجند. اما یک توسعهدهنده خلاق رویکردی شخصیتر و بامزهتر در پیش گرفته است: از سیستمهای هوش مصنوعی میخواهد یک تصویر SVG از قورباغهای با فک معروف هابسبورگ بسازند — میراث ژنتیکی قرنها ازدواج درونخانوادگی در یکی از قدرتمندترین سلسلههای سلطنتی اروپا.
این معیار ارزیابی در سادگی خود زیباست، اما در واقع از هوش مصنوعی میخواهد چندین کار را به طور همزمان انجام دهد. مدل باید بداند یک قورباغه چه شکلی دارد، از اهمیت تاریخی و پزشکی فک هابسبورگ آگاه باشد — یک فک پایین برجسته که مشخصه بسیاری از اعضای سلسله هابسبورگ بود — و سپس این دو مفهوم کاملاً متفاوت را در قالب کد SVG کارآمد ترکیب کند. این وظیفهای است که هم سواد فرهنگی و هم توانایی فنی کدنویسی را در یک پرامپت واحد میآزماید.
این پروژه در هکر نیوز توجه قابل توجهی جلب کرد و ۱۳۲ امتیاز و ۶۴ نظر به دست آورد. بحثها حول عملکرد مدلهای مختلف هوش مصنوعی در این آزمون میچرخد و نتایج به شکل چشمگیری متفاوت هستند. برخی مدلها قورباغههای SVG با جزئیات تحسینبرانگیز و ساختار فک هابسبورگ واضح تولید میکنند، در حالی که برخی دیگر در آناتومی، سینتکس SVG یا زمینه تاریخی کاملاً شکست میخورند.
این نوع معیارسنجی شخصی و خلاقانه اغلب بیشتر از آزمونهای استاندارد سنتی، تواناییهای واقعی یک هوش مصنوعی را آشکار میکند. این آزمون از مدل میخواهد دانش حوزههای کاملاً متفاوت — جانورشناسی، تاریخ اروپا و برنامهنویسی کامپیوتر — را یکپارچه کند و نتیجه را به شکلی بصری منسجم ارائه دهد. چه به عنوان ابزاری جدی برای ارزیابی و چه به عنوان یک آزمایش سرگرمکننده، آزمون قورباغه هابسبورگ پنجرهای جذاب و دلنشین به نقاط قوت و ضعف سیستمهای هوش مصنوعی مدرن میگشاید.