Page 3 - 1102 - Data Science Workbook - Full Version - Ind
P. 3

INDEX            -  CRISP - DM Data Cleansing / Data Preparation

                      » Outlier Treatment
 Ingredients of AI     » Winsorization
                      » Alpha Trimmed
 -  Artificial Intelligence     » Missing Values
 -  Data Science      » Imputation
 -  Data Mining       » Transformation
 -  Machine Learning     » Normalization/Standardization
 -  Deep Learning     » Dummy Variables
 -  Reinforcement Learning
                      » Type Casting
                      » Handling Duplicates
 Stages of Analytics     » String Manipulation

 CRISP - DM
 -  CRISP - DM Business Understanding  -  CRISP - DM Exploratory Data Analysis
 -  CRISP - DM Data Collection     » Measures of Central Tendency

    » Data Types      » Measures of Dispersion
    » Different Scales of Measurement     » Measure of Skewness
    » Data Understanding     » Measure of Kurtosis
    » Qualitative vs Quantitative     » Graphical Representations
    » Structured vs Unstructured  › Histogram
    » Big Data vs Non-Big Data  › Box Plot
    » Cross Sectional vs Time Series vs Longitudinal Data  › Q-Q Plot
    » Balanced vs Unbalanced  › Bivariate Analysis
                         - Scatter Plot
    » Data Collection Sources
 › Primary Data          - Correlation Coefficient
 › Secondary Data     » Multivariate Analysis
                      » Data Quality Analysis
    » Preliminaries for Data Analysis     » Four Errors to be Avoided During Data Collection
    » Probability     » Data Integration
    » Base Equation     » Feature Engineering
    » Random Variables     » Feature Extraction

    » Probability Distributions     » Feature Selection
    » Sampling Techniques
    » Inferential Statistics
    » Non-Probability Sampling
    » Probability Sampling
    » Sampling Funnel




































 -  CRISP - DM Model Building Using Data Mining     » Association Rules
    » Supervised Learning   › Support
    » Supervised Learning has Four Broad Problems to Solve:  › Confidence
 › Predict a Categorical Class: Classification  › Lift
 › Predict a Numerical Value: Prediction     » Recommender Systems
 › Predict User Preference from a Large Pool of Options: Recommendation  › Types of Recommendation Strategies
 › Predict Relevance of an Entity to a "Query": Retrieval  › Collaborative Filtering
    » Data Mining Unsupervised  › Similarity Measures
 › A few of the Algorithms are:  › Disadvantages
  - Clustering          › Alternative Approaches
  - Dimension Reduction  › Recommendations vs Association Rules

  - Network Analysis    › New Users and New Items
  - Association Rules     » Network Analysis
  - Online Recommendation Systems  › Applications
    » Unsupervised Preliminaries  › Degree Centrality
 › Distance Calculation  › Closeness Centrality
 › Linkages             › Betweenness Centrality
    » Clustering / Segmentation  › Eigenvector Centrality
 › K-Means Clustering   › Edge / Link Properties
 › Disadvantages of K-Means  › Cluster Coefficient
 › K-Means++ Clustering     » Text Mining
 › K-Medians Clustering  › Examples of Sources
 › K-Medoids            › Pre-Process the Data
 › Partitioning Around Medoids (PAM)  › Document Term Matrix / Term Document Matrix
 › CLARA                › Word Cloud
    » Hierarchical Clustering  › Natural Language Processing (NLP)
 › Disadvantages of Hierarchical Clustering  › Natural Language Understanding (NLU)
    » Density Based Clustering: DBSCAN  › Natural Language Generation (NLG)

    » OPTICS            › Parts of Speech Tagging (Pos)
    » Grid-Based Clustering Methods  › Named Entity Recognition (NER)
    » Three Broad Categories of Measurement in Clustering  › Topic Modelling
    » Most Common Measures   - LSA / LSI
    » Clustering Assessment Methods   - LDA
    » Finding K Value    - Text Summarization
    » Mathematical Foundations     » Data Mining Supervised Learning
    » Dimension Reduction     » Machine Learning Primer
 › PCA                  › Key Challenges
 › SVD
 › LDA
































    » Model Evaluation Techniques     » Multi-Layers Perceptron (MLP) / Artificial Neural Network (ANN)
 › Errors               › Non-Linear Patterns
 › Confusion Matrix      - Integration Function
 › Cross Table           - Activation Function
 › ROC Curve            › Regularization Techniques Used for Overfitting
    » K-Nearest Neighbor   - Error-Change Criterion
 › Choosing K Value      - Weight-Change Criterion
 › Pros and Cons        › Dropout
    » Naive Bayes Algorithm  › Drop Connect
    » Decision Tree     › Noise
 › Three Types of Nodes  › Batch Normalization
 › Greedy Algorithm     › Shuffling Inputs
 › Information Theory 101  › Weight Initialization Techniques
 › Entropy            » Forecasting
 › Pros and Cons of Decision Tree  › Time Series vs Cross Sectional Data
    » Scatter Diagram   › EDA - Components of Time Series
    » Correlation Analysis   - Systematic Part
    » Linear Regression         Level
                           º
    Ordinary Least Squares         Trend
                           º
 › Model Assumptions               Seasonality
                           º
    » Logistic Regression   - Non-Systematic Part

    » Support Vector Machine         Noise/Random
                           º
 › Hyperplane           › Data Partition
 › Non-Linear Spaces    › Forecast Model
 › Kernel Tricks         - Model-Driven Techniques
 › Kernel Functions      - Data-Driven Techniques
    » Deep Learning Primer  › Smoothing Techniques
 › Image Recognition     - Moving Average
 › Speech Data           - Exponential Smoothing
 › Text Data            › De-Trending and De-Seasoning
 › Shallow Machine Learning Models   - Regression
    » Perceptron Algorithm   - Differencing
 › Biological Neuron     - Moving Average
 › Simple Neural Network Components
 › Perceptron Algorithm
 › Learning Rate
 › Gradient Primer
 › Gradient Descent Algorithms Variants

 › Empirically Determined Components
   1   2   3   4   5   6   7   8