Page 5 - 1102 - Data Science Workbook - Full Version - Ind
P. 5
INDEX
» Outlier Treatment
» Winsorization
Ingredients of AI
» Alpha Trimmed
- Artificial Intelligence
» Missing Values
- Data Science
» Imputation
- Data Mining
» Transformation
- Machine Learning
» Normalization/Standardization
- Deep Learning
» Dummy Variables
- Reinforcement Learning
» Type Casting
» Handling Duplicates
Stages of Analytics
» String Manipulation
CRISP - DM
- CRISP - DM Business Understanding
- CRISP - DM Exploratory Data Analysis
- CRISP - DM Data Collection
» Measures of Central Tendency
» Measures of Dispersion
» Data Types
» Measure of Skewness
» Different Scales of Measurement
» Measure of Kurtosis
» Data Understanding
» Graphical Representations
» Qualitative vs Quantitative
› Histogram
» Structured vs Unstructured
› Box Plot
» Big Data vs Non-Big Data
› Q-Q Plot
» Cross Sectional vs Time Series vs Longitudinal Data
› Bivariate Analysis
» Balanced vs Unbalanced
- Scatter Plot
» Data Collection Sources
- Correlation Coefficient
› Primary Data
» Multivariate Analysis
› Secondary Data
» Data Quality Analysis
» Preliminaries for Data Analysis
» Four Errors to be Avoided During Data Collection
» Probability
» Data Integration
» Base Equation
» Feature Engineering
» Random Variables
» Feature Extraction
» Probability Distributions
» Feature Selection
» Sampling Techniques
» Inferential Statistics
» Non-Probability Sampling
» Probability Sampling
» Sampling Funnel
- CRISP - DM Model Building Using Data Mining - CRISP - DM Data Cleansing / Data Preparation
» Association Rules
» Supervised Learning › Support
» Supervised Learning has Four Broad Problems to Solve: › Confidence
› Predict a Categorical Class: Classification › Lift
› Predict a Numerical Value: Prediction » Recommender Systems
› Predict User Preference from a Large Pool of Options: Recommendation › Types of Recommendation Strategies
› Predict Relevance of an Entity to a "Query": Retrieval › Collaborative Filtering
» Data Mining Unsupervised › Similarity Measures
› A few of the Algorithms are: › Disadvantages
- Clustering › Alternative Approaches
- Dimension Reduction › Recommendations vs Association Rules
- Network Analysis › New Users and New Items
- Association Rules » Network Analysis
- Online Recommendation Systems › Applications
» Unsupervised Preliminaries › Degree Centrality
› Distance Calculation › Closeness Centrality
› Linkages › Betweenness Centrality
» Clustering / Segmentation › Eigenvector Centrality
› K-Means Clustering › Edge / Link Properties
› Disadvantages of K-Means › Cluster Coefficient
› K-Means++ Clustering » Text Mining
› K-Medians Clustering › Examples of Sources
› K-Medoids › Pre-Process the Data
› Partitioning Around Medoids (PAM) › Document Term Matrix / Term Document Matrix
› CLARA › Word Cloud
» Hierarchical Clustering › Natural Language Processing (NLP)
› Disadvantages of Hierarchical Clustering › Natural Language Understanding (NLU)
» Density Based Clustering: DBSCAN › Natural Language Generation (NLG)
» OPTICS › Parts of Speech Tagging (Pos)
» Grid-Based Clustering Methods › Named Entity Recognition (NER)
» Three Broad Categories of Measurement in Clustering › Topic Modelling
» Most Common Measures - LSA / LSI
» Clustering Assessment Methods - LDA
» Finding K Value - Text Summarization
» Mathematical Foundations » Data Mining Supervised Learning
» Dimension Reduction » Machine Learning Primer
› PCA › Key Challenges
› SVD
› LDA
» Model Evaluation Techniques » Multi-Layers Perceptron (MLP) / Artificial Neural Network (ANN)
› Errors › Non-Linear Patterns
› Confusion Matrix - Integration Function
› Cross Table - Activation Function
› ROC Curve › Regularization Techniques Used for Overfitting
» K-Nearest Neighbor - Error-Change Criterion
› Choosing K Value - Weight-Change Criterion
› Pros and Cons › Dropout
» Naive Bayes Algorithm › Drop Connect
» Decision Tree › Noise
› Three Types of Nodes › Batch Normalization
› Greedy Algorithm › Shuffling Inputs
› Information Theory 101 › Weight Initialization Techniques
› Entropy » Forecasting
› Pros and Cons of Decision Tree › Time Series vs Cross Sectional Data
» Scatter Diagram › EDA - Components of Time Series
» Correlation Analysis - Systematic Part
» Linear Regression Level
º
Ordinary Least Squares Trend
º
› Model Assumptions Seasonality
º
» Logistic Regression - Non-Systematic Part
» Support Vector Machine Noise/Random
º
› Hyperplane › Data Partition
› Non-Linear Spaces › Forecast Model
› Kernel Tricks - Model-Driven Techniques
› Kernel Functions - Data-Driven Techniques
» Deep Learning Primer › Smoothing Techniques
› Image Recognition - Moving Average
› Speech Data - Exponential Smoothing
› Text Data › De-Trending and De-Seasoning
› Shallow Machine Learning Models - Regression
» Perceptron Algorithm - Differencing
› Biological Neuron - Moving Average
› Simple Neural Network Components
› Perceptron Algorithm
› Learning Rate
› Gradient Primer
› Gradient Descent Algorithms Variants
› Empirically Determined Components

