تأثیرات دادههای پرت بر تحلیل آماری و مدل های یادگیری ماشین

مقدمه دادههای پرت (Outliers) همیشه بخشی از واقعیتهای یک دیتاست هستند. گاهی بیخطر و قابلچشمپوشی، گاهی هم مخرب و گمراهکننده است. اهمیت این دادهها فقط در مقدار غیرعادیشان نیست، بلکه در تأثیری است که میتوانند بر تحلیل، تصمیمگیری و مدلهای یادگیری ماشین داشته باشند. در این بخش بررسی میکنیم که دادههای پرت چگونه میتوانند نتایج […]
داده های پرت چیست؟کالبدشکافی Outlier ها از تعریف تا طبقهبندی

مقدمه دادههای پرت (Outliers) فقط چند عدد عجیبوغریب در جدول دادههای شما نیستند؛ آنها میتوانند یک خطای ویرانگر، نشانهای از یک مشکل پنهان یا حتی سرنخی برای یک کشف علمی بزرگ باشند. در سادهترین تعریف، دادهٔ پرت مشاهدهای است که رفتاری آنچنان متفاوت دارد که ما را به شک میاندازد: آیا واقعاً به همین مجموعه […]
مدیریت دادههای گمشده (Missing Data)

داده گمشده(Missing Value) چیست و چرا مهم است؟ در دنیای واقعی، دادهها هرگز تمیز و کامل نیستند. داده گمشده (Missing Value) به مقادیری اطلاق میشود که برای یک یا چند ویژگی (ستون) از یک یا چند مشاهده (سطر) در دسترس نیستند. این مقادیر گمشده، که اغلب با NULL، NaN (Not a Number)، ? یا یک […]
پاکسازی دادهها (Data Cleaning)

مقدمه در دنیای امروز که دادهها قلب تپندهی تحلیل، تصمیمگیری و توسعه سامانههای هوشمند هستند، کیفیت داده مهمتر از هر زمان دیگری شده است. حتی پیشرفتهترین مدلهای یادگیری ماشین نیز در صورتی که با دادههای ناقص، ناهماهنگ یا پرخطا تغذیه شوند، خروجی نادرست تولید میکنند. همین واقعیت، پاکسازی دادهها (Data Cleaning) را به یک گام […]
پیشپردازش دادهها چیست؟مراحل تکنیک ها و مثال ها

مقدمه در دنیای امروز که حجم عظیمی از دادهها از منابع مختلف تولید میشود، کیفیت و ساختار این دادهها نقش تعیینکنندهای در موفقیت تحلیلها و مدلهای دادهکاوی دارد. دادههای خام معمولاً شامل خطا، مقادیر گمشده، نویز، تناقض و ناهمگونی هستند؛ بنابراین قبل از هرگونه تحلیل، باید آنها را به شکل قابل اعتماد و ساختیافته […]
علم داده (Data Science)چیست؟

1. مقدمه در دنیای امروز که دادهها با سرعتی بيسابقه توليد ميشوند، علم داده (Data Science) به يكي از ستونهاي اصلي تصميمگيري هوشمند و مديريت كسبوكار تبديل شده است. سازمانها هر روز حجم عظيمي از دادههاي خام از پايگاههاي اطلاعاتي، سنسورها، شبكههاي اجتماعي و تعاملات مشتريان دريافت ميكنند. اما تنها زماني اين دادهها ارزشمند ميشوند […]
کاوش الگوهای متوالی | فصل 5 (بخش چهارم)
مقدمه یک پایگاه داده متوالی شامل توالیهایی از عناصر یا رویدادهای مرتب است که با یا بدون مفهوم مشخصی از زمان ثبت شدهاند. کاربردهای زیادی در زمینه دادههای متوالی وجود دارد. نمونههای معمول شامل توالیهای خرید مشتری، جریانهای کلیک وب، توالیهای بیولوژیکی و توالیهای رویدادها در علوم و مهندسی و در تحولات طبیعی و اجتماعی […]
کاوش الگوی مبتنی بر محدودیت | فصل 5 (بخش سوم)
مقدمه فرآیند کاوش الگو ممکن است هزاران الگو را از یک مجموعه داده مشخص کشف کند، که بسیاری از آنها ممکن است در نهایت بیارتباط یا بیعلاقه برای کاربران باشند. اغلب، کاربر درک خوبی از اینکه کدام «جهت» کاوش ممکن است به الگوهای جالب و «شکل» الگوها یا قوانینی که میخواهد پیدا کند، منجر شود، […]
کاوش الگوهای فشرده یا تقریبی | فصل 5 (بخش دوم)
مقدمه چالش اصلی در کاوش الگوهای پرتکرار، تعداد زیاد الگوهای کشف شده است. استفاده از یک آستانه حداقلی برای کنترل تعداد الگوهای یافت شده، تأثیر محدودی دارد. مقدار خیلی کم میتواند منجر به تولید تعداد زیادی الگوی خروجی شود، در حالی که مقدار خیلی زیاد میتواند منجر به کشف فقط الگوهای رایج شود. برای کاهش […]
کاوش الگو: روشهای پیشرفته | فصل 5 (بخش اول)
مقدمه کاوش الگوهای پرتکرار به دلیل تحقیقات قابل توجه، گسترشهای متعدد دامنه مسئله و مطالعات کاربردی گسترده، فراتر از اصول اولیه رفته است. در این فصل، روشهایی را برای کاوش الگوهای پیشرفته خواهیم آموخت. ابتدا روشهایی را برای کاوش انواع مختلف الگوها، از جمله کاوش الگوهای چندسطحی، الگوهای چندبعدی، الگوهای موجود در دادههای پیوسته، الگوهای […]