Page 5 - 1102 - Data Science Workbook - Full Version - Ind
P. 5

INDEX
                      » Outlier Treatment


                      » Winsorization
 Ingredients of AI
                      » Alpha Trimmed

 -  Artificial Intelligence

                      » Missing Values
 -  Data Science
                      » Imputation

 -  Data Mining
                      » Transformation

 -  Machine Learning

                      » Normalization/Standardization
 -  Deep Learning
                      » Dummy Variables

 -  Reinforcement Learning
                      » Type Casting


                      » Handling Duplicates
 Stages of Analytics
                      » String Manipulation

 CRISP - DM
 -  CRISP - DM Business Understanding
                  -  CRISP - DM Exploratory Data Analysis
 -  CRISP - DM Data Collection

                      » Measures of Central Tendency

                      » Measures of Dispersion

 » Data Types

                      » Measure of Skewness

 » Different Scales of Measurement

                      » Measure of Kurtosis

 » Data Understanding

                      » Graphical Representations

 » Qualitative vs Quantitative
                        › Histogram
 » Structured vs Unstructured

                        › Box Plot

 » Big Data vs Non-Big Data
                        › Q-Q Plot

 » Cross Sectional vs Time Series vs Longitudinal Data
                        › Bivariate Analysis
 » Balanced vs Unbalanced

                         - Scatter Plot

 » Data Collection Sources
                         - Correlation Coefficient
 › Primary Data

                      » Multivariate Analysis
 › Secondary Data

                      » Data Quality Analysis

 » Preliminaries for Data Analysis
                      » Four Errors to be Avoided During Data Collection


 » Probability

                      » Data Integration

 » Base Equation
                      » Feature Engineering


 » Random Variables
                      » Feature Extraction


 » Probability Distributions

                      » Feature Selection

 » Sampling Techniques
 » Inferential Statistics


 » Non-Probability Sampling

 » Probability Sampling

 » Sampling Funnel
 -  CRISP - DM Model Building Using Data Mining  -  CRISP - DM Data Cleansing / Data Preparation
                      » Association Rules

    » Supervised Learning   › Support
    » Supervised Learning has Four Broad Problems to Solve:  › Confidence
 › Predict a Categorical Class: Classification  › Lift
 › Predict a Numerical Value: Prediction     » Recommender Systems
 › Predict User Preference from a Large Pool of Options: Recommendation  › Types of Recommendation Strategies
 › Predict Relevance of an Entity to a "Query": Retrieval  › Collaborative Filtering
    » Data Mining Unsupervised  › Similarity Measures
 › A few of the Algorithms are:  › Disadvantages
  - Clustering          › Alternative Approaches
  - Dimension Reduction  › Recommendations vs Association Rules
  - Network Analysis    › New Users and New Items
  - Association Rules     » Network Analysis
  - Online Recommendation Systems  › Applications
    » Unsupervised Preliminaries  › Degree Centrality
 › Distance Calculation  › Closeness Centrality
 › Linkages             › Betweenness Centrality
    » Clustering / Segmentation  › Eigenvector Centrality
 › K-Means Clustering   › Edge / Link Properties
 › Disadvantages of K-Means  › Cluster Coefficient
 › K-Means++ Clustering     » Text Mining
 › K-Medians Clustering  › Examples of Sources
 › K-Medoids            › Pre-Process the Data
 › Partitioning Around Medoids (PAM)  › Document Term Matrix / Term Document Matrix
 › CLARA                › Word Cloud
    » Hierarchical Clustering  › Natural Language Processing (NLP)
 › Disadvantages of Hierarchical Clustering  › Natural Language Understanding (NLU)
    » Density Based Clustering: DBSCAN  › Natural Language Generation (NLG)
    » OPTICS            › Parts of Speech Tagging (Pos)
    » Grid-Based Clustering Methods  › Named Entity Recognition (NER)
    » Three Broad Categories of Measurement in Clustering  › Topic Modelling
    » Most Common Measures   - LSA / LSI
    » Clustering Assessment Methods   - LDA
    » Finding K Value    - Text Summarization
    » Mathematical Foundations     » Data Mining Supervised Learning
    » Dimension Reduction     » Machine Learning Primer
 › PCA                  › Key Challenges
 › SVD
 › LDA
    » Model Evaluation Techniques     » Multi-Layers Perceptron (MLP) / Artificial Neural Network (ANN)
 › Errors               › Non-Linear Patterns
 › Confusion Matrix      - Integration Function
 › Cross Table           - Activation Function
 › ROC Curve            › Regularization Techniques Used for Overfitting
    » K-Nearest Neighbor   - Error-Change Criterion
 › Choosing K Value      - Weight-Change Criterion
 › Pros and Cons        › Dropout
    » Naive Bayes Algorithm  › Drop Connect
    » Decision Tree     › Noise
 › Three Types of Nodes  › Batch Normalization
 › Greedy Algorithm     › Shuffling Inputs
 › Information Theory 101  › Weight Initialization Techniques
 › Entropy            » Forecasting
 › Pros and Cons of Decision Tree  › Time Series vs Cross Sectional Data
    » Scatter Diagram   › EDA - Components of Time Series
    » Correlation Analysis   - Systematic Part
    » Linear Regression         Level
                           º
    Ordinary Least Squares         Trend
                           º
 › Model Assumptions               Seasonality
                           º
    » Logistic Regression   - Non-Systematic Part
    » Support Vector Machine         Noise/Random
                           º
 › Hyperplane           › Data Partition
 › Non-Linear Spaces    › Forecast Model
 › Kernel Tricks         - Model-Driven Techniques
 › Kernel Functions      - Data-Driven Techniques
    » Deep Learning Primer  › Smoothing Techniques
 › Image Recognition     - Moving Average
 › Speech Data           - Exponential Smoothing
 › Text Data            › De-Trending and De-Seasoning
 › Shallow Machine Learning Models   - Regression
    » Perceptron Algorithm   - Differencing
 › Biological Neuron     - Moving Average
 › Simple Neural Network Components
 › Perceptron Algorithm
 › Learning Rate
 › Gradient Primer
 › Gradient Descent Algorithms Variants
 › Empirically Determined Components
   1   2   3   4   5   6   7   8   9   10