Page 6 - 1102 - Data Science Workbook - Full Version - Ind
P. 6

INDEX
                                                                                                                                                                    » Outlier Treatment

                                                                                                                                                                    » Winsorization

                  Ingredients of AI
                                                                                                                                                                    » Alpha Trimmed

                  -  Artificial Intelligence
                                                                                                                                                                    » Missing Values

                  -  Data Science
                                                                                                                                                                    » Imputation

                  -  Data Mining
                                                                                                                                                                    » Transformation

                  -  Machine Learning

                                                                                                                                                                    » Normalization/Standardization
                  -  Deep Learning
                                                                                                                                                                    » Dummy Variables

                  -  Reinforcement Learning
                                                                                                                                                                    » Type Casting

                                                                                                                                                                    » Handling Duplicates

                  Stages of Analytics

                                                                                                                                                                    » String Manipulation
                  CRISP - DM
                  -  CRISP - DM Business Understanding
                                                                                                                                                                -  CRISP - DM Exploratory Data Analysis
                  -  CRISP - DM Data Collection
                                                                                                                                                                    » Measures of Central Tendency


                                                                                                                                                                    » Measures of Dispersion
                      » Data Types

                                                                                                                                                                    » Measure of Skewness


                      » Different Scales of Measurement

                                                                                                                                                                    » Measure of Kurtosis
                      » Data Understanding


                                                                                                                                                                    » Graphical Representations

                      » Qualitative vs Quantitative
                                                                                                                                                                      › Histogram
                      » Structured vs Unstructured

                                                                                                                                                                      › Box Plot

                      » Big Data vs Non-Big Data
                                                                                                                                                                      › Q-Q Plot

                      » Cross Sectional vs Time Series vs Longitudinal Data
                                                                                                                                                                      › Bivariate Analysis

                      » Balanced vs Unbalanced
                                                                                                                                                                       - Scatter Plot
                      » Data Collection Sources

                                                                                                                                                                       - Correlation Coefficient
                        › Primary Data
                                                                                                                                                                    » Multivariate Analysis

                        › Secondary Data

                                                                                                                                                                    » Data Quality Analysis
                      » Preliminaries for Data Analysis


                                                                                                                                                                    » Four Errors to be Avoided During Data Collection

                      » Probability
                                                                                                                                                                    » Data Integration

                      » Base Equation

                                                                                                                                                                    » Feature Engineering


                      » Random Variables
                                                                                                                                                                    » Feature Extraction


                      » Probability Distributions
                                                                                                                                                                    » Feature Selection


                      » Sampling Techniques
                      » Inferential Statistics

                      » Non-Probability Sampling


                      » Probability Sampling
                      » Sampling Funnel

                                                                                                                                                                    » Association Rules

                                                                                                                                                                      › Support
                      » Supervised Learning

                                                                                                                                                                      › Confidence
                      » Supervised Learning has Four Broad Problems to Solve:

                                                                                                                                                                      › Lift
                        › Predict a Categorical Class: Classification
                                                                                                                                                                    » Recommender Systems

                        › Predict a Numerical Value: Prediction
                        › Predict User Preference from a Large Pool of Options: Recommendation
                                                                                                                                                                      › Types of Recommendation Strategies
                                                                                                                                                                      › Collaborative Filtering
                        › Predict Relevance of an Entity to a "Query": Retrieval

                      » Data Mining Unsupervised
                                                                                                                                                                      › Similarity Measures
                        › A few of the Algorithms are:
                                                                                                                                                                      › Disadvantages
                                                                                                                                                                      › Alternative Approaches
                         - Clustering
                         - Dimension Reduction
                                                                                                                                                                      › Recommendations vs Association Rules
                                                                                                                                                                      › New Users and New Items
                         - Network Analysis
                                                                                                                                                                    » Network Analysis

                         - Association Rules
                                                                                                                                                                      › Applications
                         - Online Recommendation Systems
                                                                                                                                                                      › Degree Centrality

                      » Unsupervised Preliminaries
                        › Distance Calculation
                                                                                                                                                                      › Closeness Centrality
                                                                                                                                                                      › Betweenness Centrality
                        › Linkages

                                                                                                                                                                      › Eigenvector Centrality
                      » Clustering / Segmentation
                        › K-Means Clustering
                                                                                                                                                                      › Edge / Link Properties
                                                                                                                                                                      › Cluster Coefficient
                        › Disadvantages of K-Means
                                                                                                                                                                    » Text Mining

                        › K-Means++ Clustering
                        › K-Medians Clustering
                                                                                                                                                                      › Examples of Sources
                        › K-Medoids
                                                                                                                                                                      › Pre-Process the Data
                                                                                                                                                                      › Document Term Matrix / Term Document Matrix
                        › Partitioning Around Medoids (PAM)
                                                                                                                                                                      › Word Cloud
                        › CLARA

                                                                                                                                                                      › Natural Language Processing (NLP)
                      » Hierarchical Clustering
                        › Disadvantages of Hierarchical Clustering
                                                                                                                                                                      › Natural Language Understanding (NLU)

                                                                                                                                                                      › Natural Language Generation (NLG)
                      » Density Based Clustering: DBSCAN

                      » OPTICS
                                                                                                                                                                      › Parts of Speech Tagging (Pos)
                      » Grid-Based Clustering Methods

                                                                                                                                                                      › Named Entity Recognition (NER)

                      » Three Broad Categories of Measurement in Clustering
                                                                                                                                                                      › Topic Modelling
                      » Most Common Measures
                                                                                                                                                                       - LSA / LSI


                      » Clustering Assessment Methods
                                                                                                                                                                       - LDA

                      » Finding K Value
                                                                                                                                                                       - Text Summarization

                                                                                                                                                                    » Data Mining Supervised Learning
                      » Mathematical Foundations


                      » Dimension Reduction

                                                                                                                                                                    » Machine Learning Primer
                                                                                                                                                                      › Key Challenges
                        › PCA
                        › SVD
                        › LDA
                                                                                                                                                                    » Multi-Layers Perceptron (MLP) / Artificial Neural Network (ANN)

                      » Model Evaluation Techniques
                    -  CRISP - DM Model Building Using Data Mining                                                                                              -  CRISP - DM Data Cleansing / Data Preparation
                        › Errors                                                                                                                                      › Non-Linear Patterns
                        › Confusion Matrix                                                                                                                             - Integration Function
                        › Cross Table                                                                                                                                  - Activation Function
                        › ROC Curve                                                                                                                                   › Regularization Techniques Used for Overfitting
                      » K-Nearest Neighbor                                                                                                                             - Error-Change Criterion
                        › Choosing K Value                                                                                                                             - Weight-Change Criterion
                        › Pros and Cons                                                                                                                               › Dropout
                      » Naive Bayes Algorithm                                                                                                                         › Drop Connect
                      » Decision Tree                                                                                                                                 › Noise
                        › Three Types of Nodes                                                                                                                        › Batch Normalization
                        › Greedy Algorithm                                                                                                                            › Shuffling Inputs
                        › Information Theory 101                                                                                                                      › Weight Initialization Techniques
                        › Entropy                                                                                                                                   » Forecasting
                        › Pros and Cons of Decision Tree                                                                                                              › Time Series vs Cross Sectional Data
                      » Scatter Diagram                                                                                                                               › EDA - Components of Time Series
                      » Correlation Analysis                                                                                                                           - Systematic Part
                      » Linear Regression                                                                                                                                    Level
                                                                                                                                                                         º
                      Ordinary Least Squares                                                                                                                                 Trend
                                                                                                                                                                         º
                        › Model Assumptions                                                                                                                                   Seasonality
                                                                                                                                                                         º
                      » Logistic Regression                                                                                                                            - Non-Systematic Part
                      » Support Vector Machine                                                                                                                               Noise/Random
                                                                                                                                                                         º
                        › Hyperplane                                                                                                                                  › Data Partition
                        › Non-Linear Spaces                                                                                                                           › Forecast Model
                        › Kernel Tricks                                                                                                                                - Model-Driven Techniques
                        › Kernel Functions                                                                                                                             - Data-Driven Techniques
                      » Deep Learning Primer                                                                                                                          › Smoothing Techniques
                        › Image Recognition                                                                                                                            - Moving Average
                        › Speech Data                                                                                                                                  - Exponential Smoothing
                        › Text Data                                                                                                                                   › De-Trending and De-Seasoning
                        › Shallow Machine Learning Models                                                                                                              - Regression
                      » Perceptron Algorithm                                                                                                                           - Differencing
                        › Biological Neuron                                                                                                                            - Moving Average
                        › Simple Neural Network Components
                        › Perceptron Algorithm
                        › Learning Rate
                        › Gradient Primer
                        › Gradient Descent Algorithms Variants
                        › Empirically Determined Components
   1   2   3   4   5   6   7   8   9   10   11