هوش مصنوعی چگونه کار می کند؟ توضیح ساده Machine Learning، Deep Learning و Neural Networks
وقتی از ChatGPT سوالی می پرسید، یک تصویر را با هوش مصنوعی تولید می کنید، Google Photos چهره افراد را در تصاویر تشخیص می دهد یا یک فروشگاه اینترنتی محصولی متناسب با علایق شما پیشنهاد می کند، در پشت صحنه مجموعه ای از مدل ها، الگوریتم ها، داده ها و محاسبات در حال کار هستند.
اما هوش مصنوعی واقعا چگونه کار می کند؟
برای پاسخ به این سوال باید چند مفهوم مهم را بشناسیم: داده، الگوریتم، مدل، آموزش مدل، Machine Learning، Neural Network و Deep Learning.
در این راهنمای گیتالوژی، بدون ورود غیرضروری به فرمول های ریاضی، از پایه بررسی می کنیم که یک سیستم هوش مصنوعی چگونه از داده یاد می گیرد، مدل های AI چگونه آموزش داده می شوند و فناوری هایی مانند Machine Learning و Deep Learning چه ارتباطی با هوش مصنوعی دارند.
هوش مصنوعی چگونه کار می کند؟
هیچ پاسخ واحدی برای نحوه کار تمام سیستم های هوش مصنوعی وجود ندارد؛ زیرا AI شامل مجموعه بزرگی از فناوری ها، الگوریتم ها و معماری های مختلف است.
با این حال بخش بزرگی از سیستم های مدرن AI بر یک ایده مهم متکی هستند:
به جای تعریف دستی تمام قوانین، اجازه بدهیم سیستم با استفاده از داده الگوها را یاد بگیرد.
فرض کنید قصد داریم برنامه ای بسازیم که ایمیل های Spam را تشخیص دهد.
در روش سنتی برنامه نویسی ممکن است مجموعه ای از قوانین تعریف کنیم:
اگر ایمیل شامل عبارت خاصی بود → احتمال Spam زیاد است.
اگر تعداد لینک ها بیش از مقدار مشخصی بود → احتمال Spam افزایش پیدا می کند.
اگر فرستنده ناشناس بود → یک امتیاز منفی اضافه کن.
مشکل این روش این است که دنیای واقعی بسیار پیچیده است و نمی توان برای تمام حالت های ممکن قانون نوشت.
Machine Learning رویکرد دیگری ارائه می کند.
می توان هزاران یا میلیون ها نمونه ایمیل Spam و غیر Spam را در اختیار سیستم قرار داد تا مدل از روی آنها الگوهای مفید برای تشخیص Spam را یاد بگیرد.
این تغییر نگرش یکی از پایه های اصلی انقلاب یادگیری ماشین بوده است.
تفاوت برنامه نویسی سنتی و Machine Learning چیست؟
برای درک بهتر AI، مقایسه برنامه نویسی سنتی و یادگیری ماشین بسیار مفید است.
در برنامه نویسی سنتی معمولا داریم:
Data + Rules → Output
یعنی برنامه نویس قوانین را مشخص می کند و کامپیوتر براساس آنها خروجی تولید می کند.
در Machine Learning رویکرد می تواند شبیه این باشد:
Data + Correct Outputs → Learning Algorithm → Model
مدل تلاش می کند روابط و الگوهایی را یاد بگیرد که ورودی را به خروجی مناسب مرتبط می کنند.
پس از آموزش، می توانیم داده جدید را به مدل بدهیم:
New Data → Trained Model → Prediction
این تفاوت بسیار مهم است.
در Machine Learning ما لزوما تمام قوانین را مستقیما برای سیستم نمی نویسیم؛ مدل بخشی از الگوهای مورد نیاز را از داده استخراج می کند.
چهار جزء مهم یک سیستم هوش مصنوعی
برای ساده کردن موضوع می توان بسیاری از سیستم های AI را با چهار جزء مهم توضیح داد:
داده
داده ماده اولیه بسیاری از سیستم های هوش مصنوعی است.
داده می تواند شامل موارد مختلفی باشد:
- متن
- تصویر
- صدا
- ویدئو
- اطلاعات کاربران
- اطلاعات تراکنش ها
- اطلاعات حسگرها
- داده های پزشکی
- داده های فروش
- کد
- اسناد
کیفیت داده اهمیت زیادی دارد.
اگر داده های آموزشی ناقص، اشتباه یا دارای Bias باشند، مدل نیز ممکن است الگوهای نامناسبی یاد بگیرد.
به همین دلیل جمله معروفی در علوم کامپیوتر وجود دارد:
Garbage In, Garbage Out
یعنی اگر ورودی نامناسب باشد، نمی توان انتظار خروجی قابل اعتماد داشت.
الگوریتم
Algorithm مجموعه ای از روش ها و دستورالعمل های محاسباتی است که برای حل مسئله یا یادگیری از داده استفاده می شود.
در Machine Learning الگوریتم مشخص می کند مدل چگونه از داده ها یاد بگیرد.
الگوریتم های مختلفی برای مسائل مختلف وجود دارند؛ از مدل های نسبتا ساده آماری تا شبکه های عصبی بسیار پیچیده.
مدل
Model نتیجه فرایند یادگیری است.
می توان مدل را به شکل ساده سیستمی در نظر گرفت که الگوهایی را از داده یاد گرفته و حالا می تواند روی ورودی جدید خروجی تولید کند.
برای مثال مدل می تواند:
- قیمت خانه را پیش بینی کند
- Spam را تشخیص دهد
- یک تصویر را طبقه بندی کند
- متن تولید کند
- گفتار را تشخیص دهد
- احتمال تقلب را تخمین بزند
بنابراین Algorithm و Model یک چیز نیستند.
الگوریتم روش یادگیری است؛ مدل چیزی است که طی فرایند آموزش شکل می گیرد.
قدرت محاسباتی
آموزش مدل های بزرگ AI به محاسبات بسیار زیادی نیاز دارد.
به همین دلیل توسعه GPUها و زیرساخت های محاسباتی قدرتمند نقش مهمی در پیشرفت Deep Learning داشته است.
مدل های پیشرفته ممکن است با استفاده از تعداد زیادی پردازنده تخصصی و زیرساخت های عظیم دیتاسنتری آموزش داده شوند.
Machine Learning چیست؟
Machine Learning یا یادگیری ماشین یکی از زیرمجموعه های Artificial Intelligence است.
هدف آن توسعه سیستم هایی است که بتوانند از داده یاد بگیرند و عملکرد خود را در انجام یک وظیفه بهبود دهند، بدون اینکه تمام رفتارهای مورد نیاز به صورت قانون های ثابت و دستی تعریف شوند.
یک مثال ساده را در نظر بگیریم.
فرض کنید یک فروشگاه اینترنتی اطلاعات زیر را درباره مشتریان دارد:
- محصولات مشاهده شده
- خریدهای قبلی
- دسته های مورد علاقه
- زمان حضور در صفحات
- محصولاتی که به سبد اضافه شده اند
- رفتار کاربران مشابه
یک سیستم Machine Learning می تواند این اطلاعات را تحلیل کند و احتمال علاقه کاربر به محصولات مختلف را تخمین بزند.
نتیجه می تواند همان بخش معروف باشد:
Recommended for You
که در بسیاری از پلتفرم های آنلاین مشاهده می کنیم.
مدل چگونه یاد می گیرد؟
وقتی می گوییم یک مدل «یاد می گیرد»، منظور یادگیری انسانی نیست.
مدل معمولا دارای مجموعه ای از پارامترهاست.
در ابتدای آموزش، این پارامترها ممکن است مقادیر مناسبی نداشته باشند.
مدل یک ورودی دریافت می کند و خروجی تولید می کند.
سپس خروجی مدل با نتیجه مورد انتظار مقایسه می شود.
میزان تفاوت توسط مفهومی مانند Loss اندازه گیری می شود.
فرایند آموزش تلاش می کند پارامترهای مدل را به شکلی تغییر دهد که Loss کاهش پیدا کند.
به صورت ساده:
Input → Prediction → Compare with Target → Calculate Error → Adjust Parameters → Repeat
این فرایند ممکن است بارها و بارها تکرار شود.
مدل با تکرار این چرخه به تدریج پارامترهایی پیدا می کند که عملکرد بهتری روی وظیفه مورد نظر دارند.
Training چیست؟
Training یا آموزش مدل فرایندی است که طی آن مدل با استفاده از داده و یک روش یادگیری، پارامترهای خود را تنظیم می کند.
برای مثال اگر هدف تشخیص تصاویر گربه باشد، مجموعه بزرگی از تصاویر در اختیار مدل قرار می گیرد.
مدل ابتدا ممکن است اشتباهات زیادی داشته باشد.
اما در طول Training تلاش می کند ویژگی ها و روابطی را یاد بگیرد که برای تشخیص تصاویر مفید هستند.
Training ممکن است از چند دقیقه برای مدل های ساده تا هفته ها یا حتی بیشتر برای مدل های بسیار بزرگ طول بکشد.
Inference چیست؟
بعد از آموزش مدل، مرحله دیگری وجود دارد که Inference نامیده می شود.
Inference زمانی اتفاق می افتد که مدل آموزش دیده یک ورودی جدید دریافت می کند و براساس چیزهایی که آموخته خروجی تولید می کند.
برای مثال:
وقتی Prompt خود را وارد یک مدل زبانی می کنید و پاسخ دریافت می کنید، مدل در حال انجام Inference است.
بنابراین:
Training = یادگیری پارامترهای مدل
Inference = استفاده از مدل آموزش دیده
این تفاوت یکی از مفاهیم پایه ای و بسیار مهم در AI است.
انواع اصلی Machine Learning
Machine Learning روش های مختلفی دارد، اما سه دسته بسیار مهم عبارتند از:
Supervised Learning
در Supervised Learning یا یادگیری نظارت شده، مدل با داده هایی آموزش می بیند که پاسخ صحیح آنها مشخص است.
برای مثال:
تصویر شماره ۱ → گربه
تصویر شماره ۲ → سگ
تصویر شماره ۳ → گربه
مدل تلاش می کند رابطه بین ورودی و Label را یاد بگیرد.
Supervised Learning در کارهایی مانند موارد زیر کاربرد دارد:
- تشخیص Spam
- طبقه بندی تصاویر
- پیش بینی قیمت
- تشخیص بیماری
- تحلیل ریسک
Unsupervised Learning
در Unsupervised Learning یا یادگیری بدون نظارت، داده ها لزوما Label مشخصی ندارند.
مدل تلاش می کند ساختار یا الگوهای موجود در داده را پیدا کند.
یکی از کاربردهای شناخته شده آن Clustering است.
برای مثال یک کسب و کار می تواند مشتریان خود را براساس رفتار خرید به چند گروه تقسیم کند، بدون اینکه از قبل دقیقا مشخص کرده باشد هر مشتری باید متعلق به کدام گروه باشد.
Reinforcement Learning
در Reinforcement Learning یا یادگیری تقویتی، یک Agent با محیط تعامل می کند و براساس اقدامات خود Reward یا Penalty دریافت می کند.
هدف این است که Agent سیاستی یاد بگیرد که در بلندمدت Reward بیشتری ایجاد کند.
این روش در حوزه هایی مانند:
- بازی ها
- رباتیک
- کنترل سیستم ها
- تصمیم گیری
- برخی مراحل آموزش سیستم های AI
کاربرد دارد.
Neural Network چیست؟
Neural Network یا شبکه عصبی یکی از مهم ترین مدل های مورد استفاده در AI مدرن است.
ایده اولیه شبکه های عصبی تا حدی از نحوه ارتباط نورون های زیستی الهام گرفته شده است، اما شبکه عصبی مصنوعی را نباید شبیه سازی دقیق مغز انسان تصور کرد.
یک Neural Network معمولا از لایه هایی تشکیل شده است.
در یک توضیح بسیار ساده می توان سه نوع لایه را در نظر گرفت:
Input Layer
داده وارد مدل می شود.
Hidden Layers
اطلاعات پردازش می شوند و نمایش های مختلفی از داده شکل می گیرد.
Output Layer
نتیجه نهایی تولید می شود.
در شبکه های واقعی، معماری می تواند بسیار پیچیده تر از این ساختار ساده باشد.
یک Neural Network چگونه یاد می گیرد؟
شبکه عصبی تعداد زیادی پارامتر دارد که معمولا شامل Weightها و Biasها هستند.
در هنگام Training این پارامترها تنظیم می شوند.
مدل ابتدا Prediction تولید می کند.
سپس Loss محاسبه می شود.
بعد الگوریتم های بهینه سازی تلاش می کنند مشخص کنند پارامترها چگونه تغییر کنند تا خطا کمتر شود.
یکی از مفاهیم مهم در این فرایند Backpropagation است.
Backpropagation کمک می کند تاثیر پارامترهای مختلف بر خطا محاسبه شود و شبکه بتواند وزن های خود را در جهت مناسب تنظیم کند.
Deep Learning چیست؟
Deep Learning یا یادگیری عمیق زیرمجموعه ای از Machine Learning است که معمولا با شبکه های عصبی دارای چندین لایه پردازشی سروکار دارد.
هرچه ساختار شبکه پیچیده تر باشد، مدل می تواند نمایش های پیچیده تری از داده یاد بگیرد.
برای مثال در پردازش تصویر، مدل ممکن است در مراحل مختلف ویژگی های ساده تر و سپس الگوهای پیچیده تر را استخراج کند.
Deep Learning نقش بزرگی در پیشرفت حوزه هایی مانند موارد زیر داشته است:
- Computer Vision
- Natural Language Processing
- Speech Recognition
- Generative AI
- Autonomous Systems
تفاوت AI، Machine Learning و Deep Learning چیست؟
این سه اصطلاح را می توان به صورت یک ساختار تو در تو تصور کرد:
Artificial Intelligence
حوزه کلی ساخت سیستم های دارای قابلیت های هوشمند.
↓
Machine Learning
زیرمجموعه ای از AI که سیستم ها از داده الگو یاد می گیرند.
↓
Deep Learning
زیرمجموعه ای از Machine Learning که عمدتا از شبکه های عصبی عمیق استفاده می کند.
بنابراین هر Deep Learning نوعی Machine Learning است و Machine Learning نیز بخشی از AI محسوب می شود، اما تمام روش های AI الزاما Deep Learning نیستند.
هوش مصنوعی چگونه تصویر را تشخیص می دهد؟
فرض کنید می خواهیم مدلی برای تشخیص تصاویر سگ و گربه آموزش دهیم.
در مرحله اول مجموعه بزرگی از تصاویر آماده می کنیم.
هر تصویر دارای Label است:
Dog
یا
Cat
تصویر وارد مدل می شود.
شبکه عصبی ویژگی های مختلف موجود در داده را پردازش می کند.
مدل Prediction تولید می کند.
مثلا:
Cat: 0.82
Dog: 0.18
اگر پاسخ واقعی Dog باشد، مدل اشتباه کرده است.
Loss محاسبه می شود و پارامترهای مدل تنظیم می شوند.
این فرایند روی تعداد زیادی نمونه تکرار می شود.
در نهایت هدف این است که مدل بتواند روی تصاویری که قبلا ندیده نیز عملکرد خوبی داشته باشد.
این توانایی Generalization نام دارد.
Generalization چیست؟
یکی از مهم ترین اهداف Machine Learning این نیست که مدل فقط داده های Training را حفظ کند.
مدل باید بتواند روی داده های جدید نیز عملکرد مناسبی داشته باشد.
به این قابلیت Generalization گفته می شود.
اگر یک مدل فقط داده های آموزشی را بسیار خوب یاد بگیرد اما روی داده های جدید عملکرد ضعیفی داشته باشد، ممکن است با مشکل Overfitting روبه رو باشیم.
Overfitting چیست؟
Overfitting زمانی اتفاق می افتد که مدل بیش از حد با ویژگی ها و جزئیات داده های آموزشی تطبیق پیدا کند و نتواند روی داده های جدید عملکرد مناسبی داشته باشد.
می توان آن را با دانش آموزی مقایسه کرد که پاسخ سوالات امتحان قبلی را حفظ کرده اما مفهوم درس را یاد نگرفته است.
اگر همان سوال ها تکرار شوند، عملکرد عالی دارد.
اما اگر سوال جدیدی مطرح شود، مشکل پیدا می کند.
برای جلوگیری از Overfitting از روش های مختلفی استفاده می شود؛ از جمله ارزیابی روی داده هایی که مدل هنگام آموزش ندیده است.
Training Data، Validation Data و Test Data چیست؟
در پروژه های Machine Learning معمولا داده ها به بخش های مختلف تقسیم می شوند.
Training Data
برای آموزش مدل استفاده می شود.
Validation Data
برای ارزیابی مدل در فرایند توسعه و تنظیم برخی تصمیمات مربوط به مدل استفاده می شود.
Test Data
برای سنجش نهایی عملکرد مدل روی داده هایی استفاده می شود که قرار است نماینده نمونه های دیده نشده باشند.
این تفکیک کمک می کند بهتر متوجه شویم مدل واقعا قابلیت Generalization دارد یا صرفا داده های آموزشی را یاد گرفته است.
هوش مصنوعی چگونه زبان انسان را پردازش می کند؟
زبان برای کامپیوتر به شکل خام قابل پردازش نیست و باید به نمایش عددی تبدیل شود.
در مدل های زبانی مدرن، متن معمولا ابتدا به واحدهایی به نام Token تقسیم می شود.
Token می تواند یک کلمه، بخشی از یک کلمه یا حتی علائم خاص باشد.
سپس Tokenها به نمایش های عددی تبدیل می شوند.
مدل این نمایش ها را پردازش می کند و روابط میان آنها را یاد می گیرد.
یکی از معماری هایی که تحول بزرگی در پردازش زبان ایجاد کرد Transformer بود.
Transformer امکان پردازش موثر روابط میان بخش های مختلف یک Sequence را فراهم کرد و پایه بسیاری از مدل های زبانی بزرگ مدرن شد.
Transformer چیست؟
Transformer نوعی معماری شبکه عصبی است که در سال ۲۰۱۷ در مقاله معروف «Attention Is All You Need» معرفی شد.
یکی از مفاهیم کلیدی Transformer مکانیزم Attention است.
Attention به مدل کمک می کند هنگام پردازش یک بخش از داده، اهمیت بخش های دیگر Context را نیز در نظر بگیرد.
برای مثال در یک جمله، معنای یک کلمه ممکن است به کلمات دیگری که چندین موقعیت قبل آمده اند وابسته باشد.
Transformer در مدیریت چنین روابطی بسیار موثر است و به همین دلیل به پایه بسیاری از مدل های زبانی بزرگ تبدیل شد.
مدل های زبانی بزرگ چگونه کار می کنند؟
Large Language Model یا LLM نوعی مدل است که روی حجم بزرگی از داده آموزش می بیند تا الگوهای موجود در زبان و دیگر داده های آموزشی را یاد بگیرد.
یکی از وظایف بنیادی در بسیاری از مدل های زبانی، پیش بینی Token بعدی است.
برای مثال:
«امروز هوا بسیار …»
مدل احتمال Tokenهای مختلف را براساس Context محاسبه می کند.
ممکن است احتمال دهد:
خوب → ۴۰٪
گرم → ۳۰٪
سرد → ۱۵٪
و گزینه های دیگر نیز احتمال های متفاوتی داشته باشند.
در مقیاس بسیار بزرگ، همین فرایند همراه با معماری های پیشرفته و مراحل مختلف آموزش می تواند قابلیت های پیچیده ای ایجاد کند.
آیا ChatGPT فقط کلمه بعدی را حدس می زند؟
این جمله تا حدی درست است اما می تواند بیش از حد ساده کننده باشد.
پیش بینی Token بعدی یکی از مکانیزم های بنیادی مدل های زبانی autoregressive است.
اما مدل های مدرن در فرایند آموزش نمایش های پیچیده ای از زبان، ساختار متن، روابط مفهومی، الگوهای کدنویسی و بسیاری از ساختارهای موجود در داده یاد می گیرند.
علاوه بر Pretraining، مدل های مدرن ممکن است مراحل دیگری از آموزش و بهینه سازی را نیز طی کنند تا بهتر بتوانند دستورها را دنبال کنند، پاسخ های مفیدتری تولید کنند و رفتار مناسب تری داشته باشند.
بنابراین عبارت «فقط حدس زدن کلمه بعدی» تصویر کاملی از قابلیت های یک LLM مدرن ارائه نمی دهد.
هوش مصنوعی مولد چگونه محتوا تولید می کند؟
Generative AI مدل هایی را شامل می شود که می توانند داده جدید تولید کنند.
این داده می تواند:
- متن
- تصویر
- صدا
- ویدئو
- موسیقی
- کد
باشد.
روش تولید در انواع مدل ها متفاوت است.
یک مدل زبانی ممکن است Tokenها را به صورت مرحله به مرحله تولید کند.
یک مدل تولید تصویر ممکن است از معماری و فرایند متفاوتی برای تبدیل اطلاعات ورودی به تصویر استفاده کند.
بنابراین تمام Generative AIها دقیقا به یک روش کار نمی کنند.
چرا داده برای AI اهمیت دارد؟
مدل ها از داده الگو یاد می گیرند.
اگر داده آموزشی دارای مشکل باشد، مدل نیز ممکن است تحت تاثیر قرار بگیرد.
مشکلات احتمالی داده شامل موارد زیر هستند:
- اطلاعات اشتباه
- Bias
- عدم تنوع
- داده های قدیمی
- داده های تکراری
- Labelهای اشتباه
- داده های نامرتبط
به همین دلیل توسعه AI فقط درباره انتخاب مدل قدرتمندتر نیست.
Data Quality یکی از مهم ترین بخش های توسعه سیستم های قابل اعتماد AI محسوب می شود.
آیا مدل هوش مصنوعی همه چیز را حفظ می کند؟
نه به آن شکل ساده ای که گاهی تصور می شود.
مدل طی Training پارامترهای خود را براساس الگوهای موجود در داده تنظیم می کند.
مدل یک دیتابیس ساده نیست که بتوان تصور کرد تمام صفحات آموزشی را به شکل فایل های جداگانه داخل خود ذخیره کرده است.
با این حال مدل ها می توانند در برخی شرایط بخش هایی از داده های آموزشی را Memorize کنند و این موضوع یکی از مسائل مهم تحقیقاتی در حوزه Privacy و AI Safety است.
پارامتر در هوش مصنوعی چیست؟
Parameter مقدار عددی قابل یادگیری در مدل است که طی Training تنظیم می شود.
شبکه های عصبی مدرن ممکن است میلیون ها یا میلیاردها پارامتر داشته باشند.
پارامتر بیشتر لزوما به معنی مدل بهتر نیست.
کیفیت معماری، داده آموزشی، روش Training، میزان Compute و بسیاری از عوامل دیگر روی عملکرد مدل تاثیر دارند.
چرا آموزش مدل های AI گران است؟
Training مدل های بزرگ به منابع زیادی نیاز دارد:
- GPU یا شتاب دهنده های AI
- برق
- دیتاسنتر
- ذخیره سازی داده
- شبکه پرسرعت
- مهندسان متخصص
- داده های مناسب
- زمان محاسباتی
هرچه مدل و Dataset بزرگ تر شوند، هزینه زیرساخت نیز می تواند افزایش پیدا کند.
به همین دلیل آموزش مدل های Frontier معمولا در اختیار شرکت ها و آزمایشگاه هایی است که زیرساخت محاسباتی گسترده ای در اختیار دارند.
اما استفاده از مدل های موجود بسیار ساده تر شده و افراد و کسب و کارها می توانند از طریق محصولات آماده، APIها یا مدل های Open Weight به قابلیت های AI دسترسی پیدا کنند.
آیا برای استفاده از AI باید مدل آموزش دهیم؟
خیر.
این یکی از تصورات اشتباه درباره AI است.
در بسیاری از پروژه ها اصلا نیازی به Training یک مدل از صفر وجود ندارد.
می توان از مدل های موجود استفاده کرد و آنها را با روش هایی مانند:
- Prompt Engineering
- API
- Retrieval-Augmented Generation یا RAG
- Tool Use
- Fine-Tuning در صورت نیاز
برای یک کاربرد خاص مناسب تر کرد.
در بسیاری از پروژه های واقعی، ساخت یک سیستم مناسب در اطراف مدل از آموزش یک مدل جدید اهمیت بیشتری دارد.
چرا هوش مصنوعی گاهی اشتباه می کند؟
دلایل مختلفی وجود دارد.
ممکن است:
- داده آموزشی ناقص باشد
- ورودی مبهم باشد
- مسئله خارج از توان مدل باشد
- Context کافی وجود نداشته باشد
- مدل الگوی اشتباهی را دنبال کند
- اطلاعات مورد نیاز بعد از محدوده دانش مدل ایجاد شده باشد
- سیستم به داده به روز دسترسی نداشته باشد
- خروجی احتمالاتی نامناسبی تولید شود
در مدل های Generative AI این مسئله می تواند به Hallucination منجر شود.
بنابراین AI را نباید یک منبع حقیقت مطلق در نظر گرفت.
آیا هوش مصنوعی می تواند خودش یاد بگیرد؟
پاسخ به نوع سیستم بستگی دارد.
بیشتر مدل هایی که کاربران روزانه با آنها تعامل دارند هنگام هر مکالمه پارامترهای اصلی خود را به صورت لحظه ای تغییر نمی دهند.
یعنی اگر شما اطلاعاتی به یک Chatbot بدهید، لزوما به این معنی نیست که مدل پایه همان لحظه دوباره Training می شود.
البته سیستم های AI می توانند دارای حافظه، Retrieval، Feedback Loop یا سازوکارهای یادگیری و به روزرسانی دیگری باشند.
بنابراین باید بین چند مفهوم تفاوت قائل شویم:
Training مدل
Memory سیستم
Retrieval اطلاعات
Context مکالمه
اینها یک چیز نیستند.
AI، مدل و محصول چه تفاوتی دارند؟
برای درک بهتر اکوسیستم هوش مصنوعی باید این سه مفهوم را جدا کنیم.
AI
حوزه گسترده فناوری.
Model
مدلی که با داده آموزش دیده و می تواند ورودی را پردازش کند.
AI Product
محصولی که مدل را همراه با رابط کاربری، ابزارها، دیتابیس، حافظه، API و سایر سیستم ها در اختیار کاربر قرار می دهد.
برای مثال یک Chatbot حرفه ای ممکن است فقط یک LLM نباشد.
ممکن است شامل این اجزا باشد:
User
↓
Application
↓
System Instructions
↓
LLM
↓
Tools / Search / Database / APIs
↓
Response
به همین دلیل دو محصول که حتی از یک مدل مشابه استفاده می کنند می توانند تجربه کاربری و قابلیت های بسیار متفاوتی داشته باشند.
از این مقاله چه چیزهایی باید یاد گرفته باشیم؟
تا اینجا می توانیم عملکرد بخش بزرگی از AI مدرن را در یک مسیر ساده خلاصه کنیم:
Data
↓
Learning Algorithm
↓
Training
↓
Model
↓
New Input
↓
Inference
↓
Prediction / Output
در Deep Learning، مدل معمولا یک Neural Network چندلایه است.
در مدل های زبانی، ورودی می تواند Tokenهای متن باشد.
در سیستم های دیگر، ورودی ممکن است تصویر، صدا، ویدئو یا انواع دیگری از داده باشد.
این چارچوب ساده کمک می کند بسیاری از مفاهیم پیشرفته تر AI را راحت تر درک کنیم.
چک لیست مفاهیم مهم
- AI یک فناوری واحد یا الگوریتم واحد نیست.
- Machine Learning زیرمجموعه هوش مصنوعی است.
- Deep Learning زیرمجموعه Machine Learning است.
- Neural Network یکی از مدل های مهم مورد استفاده در Deep Learning است.
- Training فرایند آموزش پارامترهای مدل است.
- Inference استفاده از مدل آموزش دیده برای ورودی جدید است.
- مدل باید بتواند روی داده های جدید Generalize کند.
- Overfitting زمانی رخ می دهد که مدل بیش از حد با داده Training تطبیق پیدا کند.
- Transformer معماری مهمی در توسعه مدل های زبانی مدرن است.
- کیفیت داده نقش مهمی در کیفیت سیستم AI دارد.
- برای استفاده از AI معمولا لازم نیست مدل را از صفر آموزش دهید.
متداول ترین سوالات
هوش مصنوعی چگونه کار می کند؟
نحوه کار سیستم های AI متفاوت است، اما بسیاری از سیستم های مدرن با استفاده از داده و الگوریتم های Machine Learning آموزش می بینند. مدل طی Training الگوهای موجود در داده را یاد می گیرد و سپس هنگام Inference از آنها برای تولید پیش بینی یا خروجی استفاده می کند.
Machine Learning چگونه یاد می گیرد؟
الگوریتم یادگیری عملکرد مدل را روی داده بررسی می کند و پارامترهای آن را به شکلی تنظیم می کند که خطا کاهش پیدا کند. این فرایند بارها تکرار می شود تا مدل عملکرد مناسب تری پیدا کند.
تفاوت Machine Learning و Deep Learning چیست؟
Deep Learning یکی از زیرمجموعه های Machine Learning است که عمدتا از شبکه های عصبی چندلایه برای یادگیری الگوهای پیچیده استفاده می کند.
Neural Network چیست؟
Neural Network یا شبکه عصبی نوعی مدل محاسباتی متشکل از واحدها و لایه های به هم متصل است که می تواند با تنظیم پارامترهای خود روابط موجود در داده را یاد بگیرد.
Training و Inference چه تفاوتی دارند؟
Training مرحله ای است که مدل از داده یاد می گیرد و پارامترهای آن تنظیم می شوند. Inference زمانی است که مدل آموزش دیده ورودی جدید دریافت می کند و خروجی تولید می کند.
آیا ChatGPT هنگام صحبت با من آموزش می بیند؟
تعامل با یک محصول AI لزوما به معنی Training لحظه ای مدل پایه نیست. Context مکالمه، Memory محصول، Retrieval و Training مدل مفاهیم متفاوتی هستند و نحوه استفاده از داده کاربران نیز به سیاست و تنظیمات هر سرویس بستگی دارد.
آیا می توان بدون برنامه نویسی هوش مصنوعی یاد گرفت؟
بله. برای درک مفاهیم AI و استفاده حرفه ای از ابزارهای هوش مصنوعی الزاما به برنامه نویسی نیاز ندارید. اما برای توسعه مدل ها، Machine Learning Engineering و ساخت سیستم های فنی پیشرفته، برنامه نویسی اهمیت زیادی دارد.