Page 6 - 1102 - Data Science Workbook - Full Version - Ind
P. 6
INDEX
» Outlier Treatment
» Winsorization
Ingredients of AI
» Alpha Trimmed
- Artificial Intelligence
» Missing Values
- Data Science
» Imputation
- Data Mining
» Transformation
- Machine Learning
» Normalization/Standardization
- Deep Learning
» Dummy Variables
- Reinforcement Learning
» Type Casting
» Handling Duplicates
Stages of Analytics
» String Manipulation
CRISP - DM
- CRISP - DM Business Understanding
- CRISP - DM Exploratory Data Analysis
- CRISP - DM Data Collection
» Measures of Central Tendency
» Measures of Dispersion
» Data Types
» Measure of Skewness
» Different Scales of Measurement
» Measure of Kurtosis
» Data Understanding
» Graphical Representations
» Qualitative vs Quantitative
› Histogram
» Structured vs Unstructured
› Box Plot
» Big Data vs Non-Big Data
› Q-Q Plot
» Cross Sectional vs Time Series vs Longitudinal Data
› Bivariate Analysis
» Balanced vs Unbalanced
- Scatter Plot
» Data Collection Sources
- Correlation Coefficient
› Primary Data
» Multivariate Analysis
› Secondary Data
» Data Quality Analysis
» Preliminaries for Data Analysis
» Four Errors to be Avoided During Data Collection
» Probability
» Data Integration
» Base Equation
» Feature Engineering
» Random Variables
» Feature Extraction
» Probability Distributions
» Feature Selection
» Sampling Techniques
» Inferential Statistics
» Non-Probability Sampling
» Probability Sampling
» Sampling Funnel
» Association Rules
› Support
» Supervised Learning
› Confidence
» Supervised Learning has Four Broad Problems to Solve:
› Lift
› Predict a Categorical Class: Classification
» Recommender Systems
› Predict a Numerical Value: Prediction
› Predict User Preference from a Large Pool of Options: Recommendation
› Types of Recommendation Strategies
› Collaborative Filtering
› Predict Relevance of an Entity to a "Query": Retrieval
» Data Mining Unsupervised
› Similarity Measures
› A few of the Algorithms are:
› Disadvantages
› Alternative Approaches
- Clustering
- Dimension Reduction
› Recommendations vs Association Rules
› New Users and New Items
- Network Analysis
» Network Analysis
- Association Rules
› Applications
- Online Recommendation Systems
› Degree Centrality
» Unsupervised Preliminaries
› Distance Calculation
› Closeness Centrality
› Betweenness Centrality
› Linkages
› Eigenvector Centrality
» Clustering / Segmentation
› K-Means Clustering
› Edge / Link Properties
› Cluster Coefficient
› Disadvantages of K-Means
» Text Mining
› K-Means++ Clustering
› K-Medians Clustering
› Examples of Sources
› K-Medoids
› Pre-Process the Data
› Document Term Matrix / Term Document Matrix
› Partitioning Around Medoids (PAM)
› Word Cloud
› CLARA
› Natural Language Processing (NLP)
» Hierarchical Clustering
› Disadvantages of Hierarchical Clustering
› Natural Language Understanding (NLU)
› Natural Language Generation (NLG)
» Density Based Clustering: DBSCAN
» OPTICS
› Parts of Speech Tagging (Pos)
» Grid-Based Clustering Methods
› Named Entity Recognition (NER)
» Three Broad Categories of Measurement in Clustering
› Topic Modelling
» Most Common Measures
- LSA / LSI
» Clustering Assessment Methods
- LDA
» Finding K Value
- Text Summarization
» Data Mining Supervised Learning
» Mathematical Foundations
» Dimension Reduction
» Machine Learning Primer
› Key Challenges
› PCA
› SVD
› LDA
» Multi-Layers Perceptron (MLP) / Artificial Neural Network (ANN)
» Model Evaluation Techniques
- CRISP - DM Model Building Using Data Mining - CRISP - DM Data Cleansing / Data Preparation
› Errors › Non-Linear Patterns
› Confusion Matrix - Integration Function
› Cross Table - Activation Function
› ROC Curve › Regularization Techniques Used for Overfitting
» K-Nearest Neighbor - Error-Change Criterion
› Choosing K Value - Weight-Change Criterion
› Pros and Cons › Dropout
» Naive Bayes Algorithm › Drop Connect
» Decision Tree › Noise
› Three Types of Nodes › Batch Normalization
› Greedy Algorithm › Shuffling Inputs
› Information Theory 101 › Weight Initialization Techniques
› Entropy » Forecasting
› Pros and Cons of Decision Tree › Time Series vs Cross Sectional Data
» Scatter Diagram › EDA - Components of Time Series
» Correlation Analysis - Systematic Part
» Linear Regression Level
º
Ordinary Least Squares Trend
º
› Model Assumptions Seasonality
º
» Logistic Regression - Non-Systematic Part
» Support Vector Machine Noise/Random
º
› Hyperplane › Data Partition
› Non-Linear Spaces › Forecast Model
› Kernel Tricks - Model-Driven Techniques
› Kernel Functions - Data-Driven Techniques
» Deep Learning Primer › Smoothing Techniques
› Image Recognition - Moving Average
› Speech Data - Exponential Smoothing
› Text Data › De-Trending and De-Seasoning
› Shallow Machine Learning Models - Regression
» Perceptron Algorithm - Differencing
› Biological Neuron - Moving Average
› Simple Neural Network Components
› Perceptron Algorithm
› Learning Rate
› Gradient Primer
› Gradient Descent Algorithms Variants
› Empirically Determined Components

