به نقل از دیجیتال مارکتینگ ایران، گوگل چارچوب جدیدی با نام R4T-Diffusion معرفی کرده است که با هدف تولید سریعتر و کمهزینهتر Query Fan-Out برای سیستمهای جستوجو و بازیابی اطلاعات طراحی شده است. این فناوری میتواند به موتورهای جستوجوی مبتنی بر هوش مصنوعی کمک کند تا یک پرسوجوی پیچیده را به مجموعهای از جستوجوهای دقیقتر و متنوعتر تبدیل کنند.
اهمیت R4T-Diffusion در این است که گوگل تلاش کرده کیفیت بالای روشهای محاسباتی سنگین را با سرعت یک مدل بسیار کوچکتر ترکیب کند. پژوهشگران گوگل میگویند مدل جدید میتواند در مقایسه با روشهای خودبازگشتی (Autoregressive) تا ۱۲ تا ۲۰ برابر سریعتر عمل کند و در عین حال هزینه محاسباتی پایینتری داشته باشد.
Query Fan-Out چیست و چرا برای AI Search اهمیت دارد؟
برای درک اهمیت R4T-Diffusion ابتدا باید مفهوم Query Fan-Out را شناخت. در جستوجوی سنتی، کاربر معمولاً یک عبارت را وارد میکند و موتور جستوجو تلاش میکند مرتبطترین نتایج را برای همان عبارت پیدا کند. اما در سیستمهای جدید جستوجوی هوش مصنوعی، یک پرسوجوی پیچیده ممکن است به چندین جستوجوی کوچکتر تقسیم شود.
برای مثال، اگر کاربر درباره بهترین لپتاپهای مناسب تدوین ویدیو در یک بازه قیمتی مشخص سؤال کند، سیستم جستوجو میتواند بهصورت همزمان جنبههای مختلفی مانند مدلهای مناسب، پردازنده، کارت گرافیک، قیمت، عمر باتری و تجربه کاربران را بررسی کند. به این فرآیند گستردهکردن یک پرسوجوی اصلی به چند زیرپرسوجو، Query Fan-Out گفته میشود.
هرچه سیستم بتواند این زیرپرسوجوها را دقیقتر و متنوعتر تولید کند، احتمال اینکه اطلاعات مناسبتری برای پاسخ نهایی پیدا شود افزایش مییابد. مشکل اصلی این است که تولید تعداد زیادی جستوجوی باکیفیت میتواند به توان پردازشی و زمان زیادی نیاز داشته باشد.
R4T-Diffusion چگونه این مشکل را حل میکند؟
چارچوب جدید گوگل با نام کامل Retrieve-for-Train-Diffusion یا R4T-Diffusion، از یک معماری سهمرحلهای استفاده میکند که آموزش تقویتی (Reinforcement Learning)، تولید داده مصنوعی و یک مدل انتشار کوچک (Diffusion Model) را با یکدیگر ترکیب میکند.
ایده اصلی این است که ابتدا رفتار یک سیستم بزرگ و پرهزینه برای تولید Query Fan-Out بررسی و آموزش داده شود. نمونههای باکیفیت تولیدشده توسط این سیستم بهعنوان داده آموزشی مورد استفاده قرار میگیرند و سپس یک مدل بسیار کوچکتر آموزش میبیند تا همان الگوی رفتاری را با هزینه بسیار کمتر بازتولید کند.
مدل انتشار مورد استفاده در این چارچوب تنها ۵۳٫۹ میلیون پارامتر دارد. در مقایسه با مدلهای بزرگ مورد استفاده در بسیاری از سامانههای هوش مصنوعی، این اندازه نسبتاً کوچک است و همین موضوع یکی از عوامل مهم در کاهش هزینه استنتاج (Inference) محسوب میشود.
سه معیار اصلی برای تولید Queryهای بهتر
یکی از نکات مهم در طراحی R4T-Diffusion توجه همزمان به سه ویژگی برای ارزیابی زیرپرسوجوها است: مرتبطبودن با دادههای قابل بازیابی، تنوع و همراستایی با پرسوجوی اصلی.
۱. Groundedness؛ ارتباط با دادههای واقعی
سیستم باید زیرپرسوجوهایی تولید کند که بتوان برای آنها نتیجه واقعی در پایگاه داده پیدا کرد. به بیان ساده، هدف جلوگیری از تولید جستوجوهای فرضی یا عباراتی است که ارتباط عملی با اطلاعات موجود ندارند.
۲. Diversity؛ جلوگیری از جستوجوهای تکراری
اگر تمام زیرپرسوجوها در واقع شکلهای مختلف یک عبارت واحد باشند، Query Fan-Out ارزش چندانی ایجاد نمیکند. R4T تلاش میکند میان زیرپرسوجوها تنوع معنایی ایجاد کند تا سیستم بتواند جنبههای مختلف موضوع را پوشش دهد.
۳. Alignment؛ حفظ ارتباط با سؤال اصلی
تنوع بهتنهایی کافی نیست. اگر زیرپرسوجوها بیش از حد از موضوع اصلی فاصله بگیرند، کیفیت پاسخ نهایی کاهش پیدا میکند. بنابراین R4T باید میان گستردهبودن جستوجو و حفظ ارتباط آن با پرسش اصلی تعادل برقرار کند.
گوگل با Distillation مدل کوچکتری ساخته است
یکی از تکنیکهای کلیدی مورد استفاده در این پروژه، Knowledge Distillation یا تقطیر دانش است. در این روش، یک مدل کوچکتر با استفاده از خروجیها و رفتار یک مدل بزرگتر آموزش میبیند.
هدف این نیست که مدل کوچک دقیقاً همان ساختار مدل بزرگ را داشته باشد؛ بلکه رفتار مفید آن را یاد میگیرد. در نتیجه میتوان بخشی از توانایی مدل بزرگ را با مدلی کوچکتر و سریعتر به دست آورد.
گوگل از همین رویکرد برای R4T استفاده کرده است. مدل بزرگتر وظیفه تولید رفتارهای باکیفیت در Query Fan-Out را بر عهده دارد و سپس این رفتارها به داده آموزشی تبدیل میشوند تا مدل انتشار ۵۳٫۹ میلیون پارامتری بتواند همان الگوها را با سرعت بالاتری اجرا کند.
R4T-Diffusion سرعت Query Fan-Out را چند برابر میکند
یکی از مهمترین ادعاهای مطرحشده درباره R4T-Diffusion، کاهش قابلتوجه زمان لازم برای تولید Query Fan-Out است. طبق توضیحات پژوهشگران گوگل، مدل جدید در مقایسه با روشهای خودبازگشتی میتواند بین ۱۲ تا ۲۰ برابر سرعت بیشتری ارائه کند.
دلیل اصلی این افزایش سرعت به شیوه تولید خروجی مربوط میشود. روشهای خودبازگشتی معمولاً خروجی را مرحلهبهمرحله تولید میکنند، در حالی که R4T-Diffusion میتواند جهتهای مختلف جستوجو را بهصورت موازی و در یک گذر غیرخودبازگشتی تولید کند.
این تفاوت زمانی اهمیت بیشتری پیدا میکند که تعداد کاربران و حجم درخواستها بسیار زیاد باشد. طبق توضیح گوگل، در شرایطی که تأخیر روشهای خودبازگشتی با افزایش حجم پردازش میتواند به نزدیک ۵۰ ثانیه برسد، R4T-Diffusion در آزمایشهای گزارششده بین کمتر از یک ثانیه تا چند ثانیه زمان نیاز داشته است.
کاربرد R4T فقط به Google Search محدود نمیشود
اگرچه Query Fan-Out یکی از کاربردهای اصلی R4T-Diffusion است، اما پژوهشگران گوگل معتقدند این چارچوب میتواند در سیستمهای دیگری نیز مورد استفاده قرار گیرد. یکی از مهمترین حوزهها، سیستمهای پیشنهاددهنده (Recommendation Systems) است.
سرویسهایی مانند Google Discover یا پیشنهادهای ویدیویی YouTube برای انتخاب محتوای مناسب از حجم زیادی از داده استفاده میکنند. سیستمی که بتواند مجموعهای متنوع و مرتبط از گزینهها را با سرعت بالا تولید و بازیابی کند، میتواند برای چنین کاربردهایی نیز مفید باشد.
این فناوری همچنین میتواند در جستوجوی اکتشافی (Exploratory Search) کاربرد داشته باشد؛ یعنی شرایطی که کاربر هنوز دقیقاً نمیداند دنبال چه چیزی است و سیستم باید مجموعهای از مسیرهای مرتبط برای کشف اطلاعات در اختیار او قرار دهد.
احتمال استفاده از R4T در AI Search
یکی از پرسشهای مهم درباره R4T-Diffusion این است که آیا گوگل همین فناوری را در سیستم جستوجوی واقعی خود مستقر کرده است یا خیر. گوگل در توضیحات مربوط به این پروژه از عبارت «Production-ready» استفاده کرده که نشان میدهد چارچوب از نظر پژوهشگران قابلیت استفاده در محیطهای عملیاتی در مقیاس بالا را دارد.
با این حال، این موضوع بهتنهایی ثابت نمیکند که R4T-Diffusion اکنون در سیستم جستوجوی عمومی گوگل یا AI Mode فعال شده است. انتشار یک مقاله پژوهشی و معرفی یک فناوری بهعنوان آماده برای تولید، با تأیید استقرار آن در تمام یا بخشی از محصولات گوگل تفاوت دارد.
برخی گزارشها و واکنشهای کاربران در شبکههای اجتماعی نیز از تغییراتی در ترافیک یا نحوه نمایش لینکها در AI Mode صحبت کردهاند. با این حال، چنین مشاهداتی بهتنهایی برای نسبتدادن تغییرات نتایج جستوجو به R4T-Diffusion کافی نیست و برای چنین نتیجهای به شواهد مستقیم از گوگل نیاز است.
R4T چه تأثیری میتواند بر SEO داشته باشد؟
اگر چارچوبهایی مانند R4T-Diffusion در سیستمهای جستوجوی هوش مصنوعی بهکار گرفته شوند، مفهوم تطبیق محتوا با جستوجو نیز میتواند پیچیدهتر شود. در چنین محیطی، موتور جستوجو صرفاً عبارت واردشده توسط کاربر را بررسی نمیکند؛ بلکه ممکن است آن را به مجموعهای از پرسشهای مرتبط تبدیل کند و برای هرکدام به دنبال منابع مناسب بگردد.
برای متخصصان SEO، این موضوع اهمیت پوشش موضوعی (Topical Coverage) و پاسخگویی به زیرموضوعهای مرتبط را بیشتر میکند. محتوایی که فقط یک عبارت کلیدی را تکرار میکند، لزوماً برای چنین سیستمهایی مفید نیست؛ در مقابل، محتوایی که یک موضوع را به شکل عمیق و ساختاریافته پوشش میدهد، میتواند برای طیف گستردهتری از جستوجوهای مرتبط قابل استفاده باشد.
البته نباید از معرفی R4T نتیجه گرفت که یک عامل مشخص اکنون معیار جدید رتبهبندی گوگل است. آنچه فعلاً میتوان گفت این است که گوگل روی فناوریهایی برای تولید و بازیابی سریعتر و متنوعتر اطلاعات در سیستمهای جستوجوی پیچیده کار میکند.
پژوهشگران درباره سوگیری هم هشدار دادهاند
سرعت و مقیاسپذیری تنها ملاحظات R4T نیستند. پژوهشگران در مقاله علمی این پروژه هشدار دادهاند که استفاده از چنین چارچوبهایی در حوزههای حساس میتواند خطر تقویت سوگیریهای موجود را به همراه داشته باشد.
به همین دلیل، آنها بر اهمیت ممیزی سوگیری متناسب با هر حوزه، طراحی فراگیر و نظارت انسانی تأکید کردهاند. این نکته نشان میدهد که بهبود سرعت بازیابی اطلاعات بهتنهایی برای استقرار یک سیستم جستوجوی هوش مصنوعی کافی نیست و کیفیت، تنوع، انصاف و نحوه استفاده از نتایج نیز باید بررسی شود.
R4T-Diffusion میتواند مسیر آینده جستوجوی هوش مصنوعی را تغییر دهد
R4T-Diffusion تلاشی برای حل یکی از مشکلات مهم AI Search است: چگونه میتوان برای یک پرسوجوی پیچیده، مسیرهای جستوجوی متنوع و باکیفیت ایجاد کرد، بدون اینکه هزینه و زمان پردازش به مانعی برای استفاده در مقیاس بزرگ تبدیل شود.
ترکیب یادگیری تقویتی، تولید داده مصنوعی و تقطیر رفتار یک مدل بزرگ در یک مدل انتشار کوچک، رویکردی است که گوگل برای رسیدن به این هدف انتخاب کرده است. ادعای سرعت ۱۲ تا ۲۰ برابری و امکان رسیدن به زمان پاسخ کمتر از چند ثانیه، در صورت تحقق در محیطهای عملیاتی، میتواند برای سامانههای جستوجوی پیچیده اهمیت زیادی داشته باشد.
با این حال، هنوز مشخص نیست R4T-Diffusion دقیقاً در چه محصولات و چه بخشهایی از زیرساخت جستوجوی گوگل استفاده میشود. بنابراین باید میان قابلیت فنی اعلامشده و استقرار واقعی این فناوری تفاوت قائل شد. آنچه روشن است، سرمایهگذاری گوگل روی نسل جدید سیستمهای بازیابی و جستوجوی مبتنی بر هوش مصنوعی و تلاش برای کاهش هزینه محاسباتی آنهاست.
برای مطالعه جدیدترین اخبار و تحلیلهای حوزه SEO، جستوجوی هوش مصنوعی و فناوریهای دیجیتال به دیجیتال مارکتینگ ایران مراجعه کنید.
“`






