تأثیرات داده‌های پرت بر تحلیل آماری و مدل های یادگیری ماشین

مقدمه داده‌های پرت (Outliers) همیشه بخشی از واقعیت‌های یک دیتاست هستند. گاهی بی‌خطر و قابل‌چشم‌پوشی، گاهی هم مخرب و گمراه‌کننده است. اهمیت این داده‌ها فقط در مقدار غیرعادی‌شان نیست، بلکه در تأثیری است که می‌توانند بر تحلیل، تصمیم‌گیری و مدل‌های یادگیری ماشین داشته باشند. در این بخش بررسی می‌کنیم که داده‌های پرت چگونه می‌توانند نتایج […]

داده های پرت چیست؟کالبدشکافی Outlier ها از تعریف تا طبقه‌بندی

مقدمه داده‌های پرت (Outliers) فقط چند عدد عجیب‌وغریب در جدول داده‌های شما نیستند؛ آن‌ها می‌توانند یک خطای ویرانگر، نشانه‌ای از یک مشکل پنهان یا حتی سرنخی برای یک کشف علمی بزرگ باشند. در ساده‌ترین تعریف، دادهٔ پرت مشاهده‌ای است که رفتاری آن‌چنان متفاوت دارد که ما را به شک می‌اندازد: آیا واقعاً به همین مجموعه […]

مدیریت داده‌های گمشده (Missing Data)

داده گمشده(Missing Value) چیست و چرا مهم است؟ در دنیای واقعی، داده‌ها هرگز تمیز و کامل نیستند. داده گمشده (Missing Value) به مقادیری اطلاق می‌شود که برای یک یا چند ویژگی (ستون) از یک یا چند مشاهده (سطر) در دسترس نیستند. این مقادیر گمشده، که اغلب با NULL، NaN (Not a Number)، ? یا یک […]

پاک‌سازی داده‌ها (Data Cleaning)

مقدمه در دنیای امروز که داده‌ها قلب تپنده‌ی تحلیل، تصمیم‌گیری و توسعه سامانه‌های هوشمند هستند، کیفیت داده مهم‌تر از هر زمان دیگری شده است. حتی پیشرفته‌ترین مدل‌های یادگیری ماشین نیز در صورتی که با داده‌های ناقص، ناهماهنگ یا پرخطا تغذیه شوند، خروجی نادرست تولید می‌کنند. همین واقعیت، پاک‌سازی داده‌ها (Data Cleaning) را به یک گام […]

پیش‌پردازش داده‌ها چیست؟مراحل تکنیک ها و مثال ها

  مقدمه در دنیای امروز که حجم عظیمی از داده‌ها از منابع مختلف تولید می‌شود، کیفیت و ساختار این داده‌ها نقش تعیین‌کننده‌ای در موفقیت تحلیل‌ها و مدل‌های داده‌کاوی دارد. داده‌های خام معمولاً شامل خطا، مقادیر گم‌شده، نویز، تناقض و ناهمگونی هستند؛ بنابراین قبل از هرگونه تحلیل، باید آن‌ها را به شکل قابل اعتماد و ساخت‌یافته […]

علم داده (Data Science)چیست؟

1. مقدمه در دنیای امروز که داده‌ها با سرعتی بي‌سابقه توليد مي‌شوند، علم داده (Data Science) به يكي از ستون‌هاي اصلي تصميم‌گيري هوشمند و مديريت كسب‌وكار تبديل شده است. سازمان‌ها هر روز حجم عظيمي از داده‌هاي خام از پايگاه‌هاي اطلاعاتي، سنسورها، شبكه‌هاي اجتماعي و تعاملات مشتريان دريافت مي‌كنند. اما تنها زماني اين داده‌ها ارزشمند مي‌شوند […]

کاوش الگوهای متوالی | فصل 5 (بخش چهارم)

مقدمه یک پایگاه داده متوالی شامل توالی‌هایی از عناصر یا رویدادهای مرتب است که با یا بدون مفهوم مشخصی از زمان ثبت شده‌اند. کاربردهای زیادی در زمینه داده‌های متوالی وجود دارد. نمونه‌های معمول شامل توالی‌های خرید مشتری، جریان‌های کلیک وب، توالی‌های بیولوژیکی و توالی‌های رویدادها در علوم و مهندسی و در تحولات طبیعی و اجتماعی […]

کاوش الگوی مبتنی بر محدودیت | فصل 5 (بخش سوم)

مقدمه فرآیند کاوش الگو ممکن است هزاران الگو را از یک مجموعه داده مشخص کشف کند، که بسیاری از آنها ممکن است در نهایت بی‌ارتباط یا بی‌علاقه برای کاربران باشند. اغلب، کاربر درک خوبی از اینکه کدام «جهت» کاوش ممکن است به الگوهای جالب و «شکل» الگوها یا قوانینی که می‌خواهد پیدا کند، منجر شود، […]

کاوش الگوهای فشرده یا تقریبی | فصل 5 (بخش دوم)

مقدمه چالش اصلی در کاوش الگوهای پرتکرار، تعداد زیاد الگوهای کشف شده است. استفاده از یک آستانه حداقلی برای کنترل تعداد الگوهای یافت شده، تأثیر محدودی دارد. مقدار خیلی کم می‌تواند منجر به تولید تعداد زیادی الگوی خروجی شود، در حالی که مقدار خیلی زیاد می‌تواند منجر به کشف فقط الگوهای رایج شود. برای کاهش […]

کاوش الگو: روش‌های پیشرفته | فصل 5 (بخش اول)

مقدمه کاوش الگوهای پرتکرار به دلیل تحقیقات قابل توجه، گسترش‌های متعدد دامنه مسئله و مطالعات کاربردی گسترده، فراتر از اصول اولیه رفته است. در این فصل، روش‌هایی را برای کاوش الگوهای پیشرفته خواهیم آموخت. ابتدا روش‌هایی را برای کاوش انواع مختلف الگوها، از جمله کاوش الگوهای چندسطحی، الگوهای چندبعدی، الگوهای موجود در داده‌های پیوسته، الگوهای […]

error: Content is protected !!