Page 2 - 1102 - Data Science Workbook - Full Version - Ind
P. 2

INDEX                                                                                                                                         -  CRISP - DM Data Cleansing / Data Preparation

                                                                                                                                                                    » Outlier Treatment
                  Ingredients of AI                                                                                                                                 » Winsorization
                                                                                                                                                                    » Alpha Trimmed
                  -  Artificial Intelligence                                                                                                                         » Missing Values
                  -  Data Science                                                                                                                                   » Imputation
                  -  Data Mining                                                                                                                                    » Transformation
                  -  Machine Learning                                                                                                                               » Normalization/Standardization
                  -  Deep Learning                                                                                                                                  » Dummy Variables
                  -  Reinforcement Learning
                                                                                                                                                                    » Type Casting
                                                                                                                                                                    » Handling Duplicates
                  Stages of Analytics                                                                                                                               » String Manipulation

                  CRISP - DM
                  -  CRISP - DM Business Understanding                                                                                                          -  CRISP - DM Exploratory Data Analysis
                  -  CRISP - DM Data Collection                                                                                                                     » Measures of Central Tendency

                      » Data Types                                                                                                                                  » Measures of Dispersion
                      » Different Scales of Measurement                                                                                                              » Measure of Skewness
                      » Data Understanding                                                                                                                          » Measure of Kurtosis
                      » Qualitative vs Quantitative                                                                                                                 » Graphical Representations
                      » Structured vs Unstructured                                                                                                                    › Histogram
                      » Big Data vs Non-Big Data                                                                                                                      › Box Plot
                      » Cross Sectional vs Time Series vs Longitudinal Data                                                                                           › Q-Q Plot
                      » Balanced vs Unbalanced                                                                                                                        › Bivariate Analysis
                                                                                                                                                                       - Scatter Plot
                      » Data Collection Sources
                        › Primary Data                                                                                                                                 - Correlation Coefficient
                        › Secondary Data                                                                                                                            » Multivariate Analysis
                                                                                                                                                                    » Data Quality Analysis
                      » Preliminaries for Data Analysis                                                                                                             » Four Errors to be Avoided During Data Collection
                      » Probability                                                                                                                                 » Data Integration
                      » Base Equation                                                                                                                               » Feature Engineering
                      » Random Variables                                                                                                                            » Feature Extraction

                      » Probability Distributions                                                                                                                   » Feature Selection
                      » Sampling Techniques
                      » Inferential Statistics
                      » Non-Probability Sampling
                      » Probability Sampling
                      » Sampling Funnel




































                  -  CRISP - DM Model Building Using Data Mining                                                                                                    » Association Rules
                      » Supervised Learning                                                                                                                           › Support
                      » Supervised Learning has Four Broad Problems to Solve:                                                                                         › Confidence
                        › Predict a Categorical Class: Classification                                                                                                  › Lift
                        › Predict a Numerical Value: Prediction                                                                                                     » Recommender Systems
                        › Predict User Preference from a Large Pool of Options: Recommendation                                                                        › Types of Recommendation Strategies
                        › Predict Relevance of an Entity to a "Query": Retrieval                                                                                      › Collaborative Filtering
                      » Data Mining Unsupervised                                                                                                                      › Similarity Measures
                        › A few of the Algorithms are:                                                                                                                › Disadvantages
                         - Clustering                                                                                                                                 › Alternative Approaches
                         - Dimension Reduction                                                                                                                        › Recommendations vs Association Rules

                         - Network Analysis                                                                                                                           › New Users and New Items
                         - Association Rules                                                                                                                        » Network Analysis
                         - Online Recommendation Systems                                                                                                              › Applications
                      » Unsupervised Preliminaries                                                                                                                    › Degree Centrality
                        › Distance Calculation                                                                                                                        › Closeness Centrality
                        › Linkages                                                                                                                                    › Betweenness Centrality
                      » Clustering / Segmentation                                                                                                                     › Eigenvector Centrality
                        › K-Means Clustering                                                                                                                          › Edge / Link Properties
                        › Disadvantages of K-Means                                                                                                                    › Cluster Coefficient
                        › K-Means++ Clustering                                                                                                                      » Text Mining
                        › K-Medians Clustering                                                                                                                        › Examples of Sources
                        › K-Medoids                                                                                                                                   › Pre-Process the Data
                        › Partitioning Around Medoids (PAM)                                                                                                           › Document Term Matrix / Term Document Matrix
                        › CLARA                                                                                                                                       › Word Cloud
                      » Hierarchical Clustering                                                                                                                       › Natural Language Processing (NLP)
                        › Disadvantages of Hierarchical Clustering                                                                                                    › Natural Language Understanding (NLU)
                      » Density Based Clustering: DBSCAN                                                                                                              › Natural Language Generation (NLG)

                      » OPTICS                                                                                                                                        › Parts of Speech Tagging (Pos)
                      » Grid-Based Clustering Methods                                                                                                                 › Named Entity Recognition (NER)
                      » Three Broad Categories of Measurement in Clustering                                                                                           › Topic Modelling
                      » Most Common Measures                                                                                                                           - LSA / LSI
                      » Clustering Assessment Methods                                                                                                                  - LDA
                      » Finding K Value                                                                                                                                - Text Summarization
                      » Mathematical Foundations                                                                                                                    » Data Mining Supervised Learning
                      » Dimension Reduction                                                                                                                         » Machine Learning Primer
                        › PCA                                                                                                                                         › Key Challenges
                        › SVD
                        › LDA
































                      » Model Evaluation Techniques                                                                                                                 » Multi-Layers Perceptron (MLP) / Artificial Neural Network (ANN)
                        › Errors                                                                                                                                      › Non-Linear Patterns
                        › Confusion Matrix                                                                                                                             - Integration Function
                        › Cross Table                                                                                                                                  - Activation Function
                        › ROC Curve                                                                                                                                   › Regularization Techniques Used for Overfitting
                      » K-Nearest Neighbor                                                                                                                             - Error-Change Criterion
                        › Choosing K Value                                                                                                                             - Weight-Change Criterion
                        › Pros and Cons                                                                                                                               › Dropout
                      » Naive Bayes Algorithm                                                                                                                         › Drop Connect
                      » Decision Tree                                                                                                                                 › Noise
                        › Three Types of Nodes                                                                                                                        › Batch Normalization
                        › Greedy Algorithm                                                                                                                            › Shuffling Inputs
                        › Information Theory 101                                                                                                                      › Weight Initialization Techniques
                        › Entropy                                                                                                                                   » Forecasting
                        › Pros and Cons of Decision Tree                                                                                                              › Time Series vs Cross Sectional Data
                      » Scatter Diagram                                                                                                                               › EDA - Components of Time Series
                      » Correlation Analysis                                                                                                                           - Systematic Part
                      » Linear Regression                                                                                                                                    Level
                                                                                                                                                                         º
                      Ordinary Least Squares                                                                                                                                 Trend
                                                                                                                                                                         º
                        › Model Assumptions                                                                                                                                   Seasonality
                                                                                                                                                                         º
                      » Logistic Regression                                                                                                                            - Non-Systematic Part
                      » Support Vector Machine                                                                                                                               Noise/Random
                                                                                                                                                                         º
                        › Hyperplane                                                                                                                                  › Data Partition
                        › Non-Linear Spaces                                                                                                                           › Forecast Model
                        › Kernel Tricks                                                                                                                                - Model-Driven Techniques
                        › Kernel Functions                                                                                                                             - Data-Driven Techniques
                      » Deep Learning Primer                                                                                                                          › Smoothing Techniques
                        › Image Recognition                                                                                                                            - Moving Average
                        › Speech Data                                                                                                                                  - Exponential Smoothing
                        › Text Data                                                                                                                                   › De-Trending and De-Seasoning
                        › Shallow Machine Learning Models                                                                                                              - Regression
                      » Perceptron Algorithm                                                                                                                           - Differencing
                        › Biological Neuron                                                                                                                            - Moving Average
                        › Simple Neural Network Components
                        › Perceptron Algorithm
                        › Learning Rate
                        › Gradient Primer
                        › Gradient Descent Algorithms Variants

                        › Empirically Determined Components
   1   2   3   4   5   6   7