فناوری كلیدی در هوش مصنوعی؛
پژوهشگر ایرانی چطور نفرین داده ها در ابعاد بالا را شکست؟
جاوید شو: پژوهشگر ایرانی راهکاری مؤثر برای جست وجوی سریع داده های مشابه در مجموعه های عظیم ارایه کرده است؛ دستاوردی که امروز از فناوری های کلیدی در پردازش کلان داده و هوش مصنوعی محسوب می شود.
به گزارش جاوید شو به نقل از مهر، وقتی روی یک خط مستقیم ایستاده اید و می خواهید نزدیک ترین فرد به خویش را پیدا کنید، کار ساده است: فقط کافی است به چپ و راست نگاه کنید و فاصله تان را با افراد اطراف مقایسه کنید. حال اگر در یک اتاق باشید، باید نزدیک ترین فرد را در فضای دوبعدی پیدا کنید. باز هم مشکل چندانی وجود ندارد؛ با چرخیدن به دور خود و بررسی فاصله ها در جهات مختلف، می توانید جواب را بیابید.
اما اگر افراد بتوانند در فضای سه بعدی شناور شوند، چه؟ در این صورت، مسئله پیچیده تر می شود؛ چون باید جست وجو را در ارتفاع، عمق و عرض انجام دهید. اگر بُعد زمان را هم اضافه نماییم، اوضاع کاملا بغرنج می شود. حتی اگر تمام عمرتان هم وقت داشته باشید، آیا می توانید نزدیک ترین فرد را در یک فضای چهاربعدی پیدا کنید؟
واقعیت تکان دهنده اینجاست: خیلی از داده های دنیای واقعی در ابعاد خیلی بالاتری وجود دارند؛ گاهی ۱۰۰ بُعد یا حتی بیشتر. این داده ها نفرین شده اند!
در این میان، دکتر وهاب میررکنی، پژوهشگر ایرانی و دانش آموخته دانشگاه صنعتی شریف و مؤسسه فناوری ماساچوست (MIT)، با ارایه الگوریتم «هش حساس به مجاورت» (LSH)، راهکاری مؤثر برای جست وجوی سریع داده های مشابه در مجموعه های عظیم ارایه کرد؛ دستاوردی که امروز از فناوری های کلیدی در پردازش کلان داده و هوش مصنوعی به حساب می آید. میررکنی که حال از محققان ارشد گوگل است، به پاس این موفقیت، در سال ۲۰۲۵ بعنوان یکی از برگزیدگان جایزه مصطفی(ص) معرفی گردید.
برای درک بهتر این موفقیت، بهتر است ابتدا با یکی از چالش های بنیادین عصر داده بیشتر آشنا شویم؛ مسئله ای که یافتن یک قطعه اطلاعات پرارزش در بین انبوهی از داده ها را به جست وجوی سوزنی در انباری عظیم از کاه مبدل کرده است.
داده های نفرین شده
با پیشرفت فناوری و ورود داده های مختلف به دنیای محاسبات و پردازش، با انواع مختلفی از داده های نفرین شده روبه رو شده ایم. یک تصویر رنگی ۱۰۰۰×۱۰۰۰ پیکسلی (که هر پیکسل در آن یک بُعد است) در کامپیوتر، داده ای سه میلیون بعدی محسوب می شود! چونکه برای نگهداری هر پیکسل، باید ترکیب سه تایی قرمز، سبز و آبی، که یکی از شیوه های استاندارد نگهداری تصاویر رنگی است، ذخیره شود. حتی با بهره گیری از شیوه های کاهش ابعاد، باز هم در مسایل پردازش تصویر با صدها یا هزاران بُعد سروکار داریم.
زمانی که قصد پردازش فایل های متنی را داریم، در حقیقت وارد فضای مسائلی می شویم که به آن پردازش زبان طبیعی گفته می شود. در اینگونه موارد، کلمات با روش هایی به بردار عددی تبدیل می شوند. به هر کلمه یک بردار عددی n-بعدی (۱۰۰ تا ۳۰۰ بُعدی) نسبت داده می شود، به شکلی که کلمات مشابه، بردارهای مشابهی داشته باشند. سپس برای پردازش یک متن، کلمات اصلی شناسایی، استخراج و بررسی می شوند. با این شیوه ها، یک متن که تلفیقی از چندین کلمه است، داده ای با ابعاد خیلی بالا خواهد بود. یک پاراگراف می تواند ده ها هزار بُعد داشته باشد!
نمونه ای دیگر از داده هایی که در دهه اخیر خیلی مورد توجه قرار گرفته، داده های ژنتیکی هستند. در هر سلول از هر موجود زنده ای، مولکولی به نام DNA وجود دارد که از به هم پیوستن ۴ نوع مولکول ساده تر که به «باز» معروف اند، تشکیل شده است. با عنایت به اینکه طول آن در انسان به حدود ۳ میلیارد تکرار از این بازها می رسد، از نظر نظری می توان تنوع خیلی بالایی برای آن درنظر گرفت. قسمتهایی از DNA در ضمن نسل ها تا حد خیلی زیادی حفظ می شوند و عملکرد بدن موجود زنده را تعیین می کنند که به آنها ژن گفته می شود. نگهداری اطلاعات DNA هر انسان می تواند به دو شکل صورت گیرد: یا کل توالی مولکولی آن نگهداری شود، یا تنها بخش های ژن که حدوداً ۲۵ هزار بخش با طول های متفاوت هستند، نگهداری شود. در هر صورت، با حجم اطلاعات خیلی بالایی مواجه خواهیم بود.
چالش جست وجو در داده های پُربُعد؛ همه نزدیک اند و همه دور!
در چنین فضای پُربُعدی، «نفرین ابعاد بالا» رخ می دهد. نفرین این چنین است که داده ها بشکل عجیبی پراکنده می شوند، طوری که تقریبا همه چیز به یک اندازه از هم فاصله دارند. به بیانی دیگر، مفهوم «شباهت» از بین می رود، چون همه داده ها تقریبا یکسان به نظر می رسند و جست وجوی نزدیک ترین همسایه یا شبیه ترین داده، به یک ماموریت نا ممکن تبدیل می شود و محاسبات، غیرعملی می گردند.
مسئله جست وجوی نزدیک ترین همسایه یکی از مسایل کلیدی در علوم داده، یادگیری ماشین و بازیابی اطلاعات است. هدف اصلی این مساله، یافتن نزدیک ترین نقطه (یا نقاط) به یک نقطه داده شده است که می تواند بر مبنای یک معیار شباهت مطرح شود. معیارهای مختلفی برای سنجش فاصله داده ها وجود دارد. دو نوع از ساده ترین آنها، فاصله اقلیدسی و فاصله منهتن است. در فاصله اقلیدسی، طول پاره خطی که آن دو نقطه را در فضا مستقیماً به یکدیگر وصل می کند، مدنظر است و در فاصله منهتن، فاصله پلکانی برای رسیدن از یک نقطه به نقطه دیگر درنظر گرفته می شود؛ یعنی حاصل جمع اختلاف داده ها در ابعاد مختلف.
یافتن شبیه ترین تصویر به تصویر مدنظر ما از میان یک پایگاه داده تصویری، یا یافتن شبیه ترین موجودات به یکدیگر به لحاظ ژنتیکی و ساخت شجره نامه موجودات از دیدگاه تکامل، به نظر صورت مسئله های ساده ای می آیند، اما چالش های خیلی پیچیده ای دارند. گاهی حتی نیازهایی بر اساس تشخیص شباهت متنی و تقلب علمی مطرح می شود یا تحلیلی از احساسات بیان شده در متن ها مدنظر است. بازار تبلیغات و آگهی و سیستم های پیشنهاددهنده نیز اگر بخواهند بنا بر سلیقه شما و کاربران مشابه، محصولی پیشنهاد دهند، از این چالش ها مستثنی نیستند. در حقیقت، در تمام این مسایل عنوان شده، ما تنها به دنبال شبیه ترین داده به یک داده خاص هستیم که اگر ابعاد داده ها کم بود، با شیوه های سنتی و الگوریتم های سریع، پاسخ در زمان معقولی آماده بود؛ اما آن چه ما را در پاسخ دادن به این سوال ها گرفتار مشکل می کند، ابعاد خیلی بالای آن هاست.
شباهت در دنیایی دیگر!
محققان بسیاری اهتمام در ارایه چاره ای برای این مسئله داشته اند و با عنایت به فضای خیلی پیچیده مساله، صورت مسئله را به جای یافتن «نزدیک ترین داده»، به یافتن «داده به قدر لازم نزدیک» تغییر دادند. اما باز هم از پیچیدگی موضوع کم نشد. یکی از مؤثرترین افراد این حوزه، وهاب میررکنی است که این داده ها را می شناخت و می دانست که نمی توان مستقیم با آنها دست وپنجه نرم کرد؛ چونکه نفرین آنها به این راحتی شکسته نمی شود و فضا خیلی پیچیده تر از آن است که بتوان مستقیم وارد عمل شد.
شاید اگر مسئله را به این شکل نگاه نماییم، بتوانیم درک خوبی از تحقیقات این دانشمند پیدا کنیم: کتابی خوانده اید که شما را بشدت به خود جذب کرده است. بعد از اتمام کتاب، به دنبال خواندن کتاب دیگری می گردید که فضای ذهنی شما را به همان شکل به خود جذب نماید. چطور میتوان چنین کتابی را از میان میلیونها کتاب با انواع و اقسام نویسنده، موضوع و عنوان و... یافت؟ مسلماً عاقلانه نخواهد بود اگر یک نفر زمان خویش را صرف آن کند که تمام کتاب های کتابخانه را بخواند و ببیند کدام یک به کتاب مورد علاقه او شبیه تر است!
در سال ۱۹۹۸، ایده مبتنی بر «هش حساس به مجاورت» به نام LSH عنوان شد که شیوه جست وجو در داده ها را متحول کرد: به جای مقایسه مستقیم میلیونها معیار، می توان از روش دسته بندی هوشمندانه استفاده نمود. تصور کنید کتابخانه ای عظیم دارید. به جای بررسی تک تک کتاب ها، ابتدا آنها را بر مبنای موضوع دسته بندی می کنید: تاریخی، فلسفی، ادبی و... و زمانی که به دنبال کتابی مشابه می گردید، فقط در قسمت مربوطه جست وجو می کنید. این همان ایده تبدیل داده های پیچیده به فضایی ساده تر است؛ کاری که با توابع هش ممکن می شود.
البته این ایده در ابتدا خام بود. دسته بندی های تک بعدی (مثلاً فقط برپایه موضوع) ممکن بود ناقص باشد. برای حل این مشکل، از چندین روش دسته بندی هم زمان استفاده شد. بطورمثال کتاب ها را نه فقط بر مبنای موضوع، بلکه برپایه حجم (رمان بلند، داستان کوتاه) و دوره تاریخی (رنسانس، معاصر) نیز طبقه بندی می کردند. حالا هر کتاب در چندین گروه قرار می گرفت. بعنوان نمونه، رمان بلندی با موضوع فلسفی و متعلق به قرن پنجم، تنها با کتاب های هم گروه خود مقایسه می شد. به این ترتیب، داده های میلیون بعدی به چند بُعد ساده تقلیل می یافتند و جست وجو خیلی سریع تر انجام می شد.
اما یافتن چنین توابع هشی در ریاضیات کار ساده ای نبود؛ چونکه باید از توابعی استفاده می شد که شباهت در دنیای اصلی را حفظ می کردند و داده های شبیه به هم را به مکانی نزدیک به هم در دنیای جدید می بردند. چاره، استفاده از توابع هش تصادفی بود. چرا تصادفی؟ چون داده ها آن قدر پیچیده هستند که پیشبینی بهترین روش دسته بندی نا ممکن است. از طرفی، توابع تصادفی با تشکیل نمایی غیرقابل پیشبینی از داده ها، گاهی دسته بندی های بهتری ارایه می دادند.
LSH تا بدین جا خوب عمل کرده بود، اما محدود بود و برای حفظ شباهت، عموماً از توابع هش مشابه تر استفاده می کرد و از توابع نادر کمتر بهره می گرفت. در حقیقت، به شکلی توابع هش مورد استفاده بر اساس توزیع نرمال تولید می شدند؛ بنابراین، تنها می توانست روی دو معیار محاسبه فاصله یا متر معروف، اقلیدسی و منهتن، پاسخ مناسب عرضه نماید. از ین جهت، این شیوه برای هر نوع داده و هر متری کارآمدی لازم را نداشت و حفظ شباهت در فضای جدید را برای هر نوع داده ای تضمین نمی کرد.
در سال ۲۰۰۴ بود که وهاب میررکنی و همکارانش با ارایه تعمیمی نوآورانه، همه چیز را تغییر دادند. آنها با معرفی LSH مبتنی بر توزیع های پایدار، سیستمی ساختند که تقریبا با هر نوع داده و معیاری سازگار بود. در این شیوه، تولید توابع هش تنها متمرکز بر توزیع نرمال نبود و توابع هش نادر نیز امکان استفاده بیشتری داشتند و بنابراین، داده ها را با توابع عجیب تر بیشتری می شد دسته بندی کرد و بسته به نوع معیار محاسبه فاصله مدنظر، می توانست توزیع توابع را تغییر داد. در حقیقت، هنر میررکنی این بود که از نظر ریاضی، امکان استفاده از شیوه های متنوع و حتی نادرتری برای دسته بندی داده ها را فراهم نمود.
میررکنی و همکارانش با سودجستن از توزیع های پایدار، این اطمینان را دادند که داده های مشابه در فضای جدید نیز نزدیک به هم باقی می مانند. زیبایی کار این بود که این شیوه برای هر معیاری، از اقلیدسی و منهتن تا معیارهای محاسبه فاصله پیچیده دیگر نیز قابل استفاده بود.
نتایج اعجاب انگیز بود: روش جدید تا ۴۰ برابر سریع تر از شیوه های سنتی عمل می کرد. میررکنی با این نوآوری، موفقیت برجسته ای در دنیای جست وجوی داده های پُربُعد ایجاد کرد. دیگر سرعت و دقت جست وجو به تعداد ابعاد داده وابسته نبود. حالا می شد در بین میلیونها کتاب، به سادگی و با سرعت بالا، کتاب بعدی را برای مطالعه پیدا کرد و نگران نفرین ابعاد بالا نبود. این همان هنر تبدیل جهان پیچیده داده ها به فضایی ساده و قابل مدیریت بود. با ارایه این راه حل، زمینه ای برقرار شد تا اشخاصی که روی داده هایی با ابعاد بالا، از تصویر گرفته تا صدا و متن و داده های ژنتیکی و نظرسنجی های سایت ها و پیشنهاددهنده های محصول و... مطالعه می کنند، بتوانند هر زمان لازم بود، از این ایده استفاده نمایند.
حرف آخر اینکه نگهداری اطلاعات DNA هر انسان می تواند به دو شکل صورت گیرد: یا کل توالی مولکولی آن نگهداری شود، یا تنها بخش های ژن که حدوداً ۲۵ هزار بخش با طول های متفاوت هستند، نگهداری شود. در فاصله اقلیدسی، طول پاره خطی که آن دو نقطه را در فضا مستقیماً به یکدیگر وصل می کند، مدنظر است و در فاصله منهتن، فاصله پلکانی برای رسیدن از یک نقطه به نقطه دیگر در نظر گرفته می شود؛ یعنی حاصل جمع اختلاف داده ها در ابعاد مختلف. اما باز هم از پیچیدگی مبحث کم نشد.
منبع: جاوید شو
این پست جاوید شو را پسندیدید؟
(1)
(0)
تازه ترین مطالب مرتبط
نظرات بینندگان در مورد این مطلب