GST Technologies
DATASCIENCE COURSES

 

Introduction to Data Science
Data Science Lifecycle (Data Collection → Wrangling → Analysis → Modeling → Communication)
Roles: Data Scientist, Data Analyst, Data Engineer
Applications: Finance, Healthcare, Marketing, E-commerce, Social Media
Mathematics & Statistics for Data Science
A. Linear Algebra Vectors, Matrices, Tensors
Matrix Operations
Eigenvalues & Eigenvectors
Applications in ML (e.g., PCA)
B. Calculus Derivatives and Gradients
Partial Derivatives
Chain Rule
Applications in Optimization (e.g., Gradient Descent)
C. Probability and Statistics Descriptive Statistics: Mean, Median, Mode, Variance, Skewness
Probability Theory: Bayes Theorem, Conditional Probability
Distributions: Normal, Binomial, Poisson, Uniform
Hypothesis Testing: p-value, t-test, ANOVA, Chi-Square
Confidence Intervals and Z-scores
Central Limit Theorem
Programming for Data Science
Python or R (Primary Language)
Variables, Loops, Functions
List Comprehensions, Lambda Functions
Error Handling, File I/O
Object-Oriented Programming (OOP)
Python Libraries: NumPy (Arrays and Linear Algebra)
Pandas (DataFrames, Data Cleaning, Merging)
Matplotlib & Seaborn (Data Visualization)
Scikit-learn (ML Models)
Statsmodels (Statistical Analysis)
Data Wrangling & Preprocessing
Data Collection Techniques: APIs, Web Scraping, SQL
Handling Missing Values
Data Cleaning: Duplicates, Typos, Outliers
Data Transformation: Normalization, Standardization
Feature Engineering
Encoding Categorical Variables (One-Hot, Label Encoding)
Date/Time Handling
Exploratory Data Analysis (EDA)
Univariate Analysis
Bivariate & Multivariate Analysis
Correlation Analysis
Boxplots, Histograms, Heatmaps
Detecting Outliers
Business Understanding from Data Patterns
Machine Learning Fundamentals
Supervised Learning: Linear Regression
Logistic Regression
Decision Trees and Random Forests
K-Nearest Neighbors (KNN)
Support Vector Machines (SVM)
Naive Bayes Classifier
Unsupervised Learning: Clustering: K-means, Hierarchical, DBSCAN
Dimensionality Reduction: PCA, t-SNE
Model Evaluation: Train-Test Split, Cross-Validation
Metrics: Accuracy, Precision, Recall, F1 Score, ROC-AUC
Confusion Matrix
Advanced Machine Learning & Deep Learning
Ensemble Methods: Bagging, Boosting (XGBoost, LightGBM)
Neural Networks (ANN)
CNNs (Computer Vision)
RNNs and LSTM (Time Series / NLP)
Deep Learning Frameworks: TensorFlow, Keras, PyTorch
Time Series Analysis
Components: Trend, Seasonality, Noise
AR, MA, ARMA, ARIMA models
Forecasting Techniques
Exponential Smoothing
Prophet Model by Facebook
Natural Language Processing (NLP)
Text Preprocessing: Tokenization, Stop Words, Stemming, Lemmatization
Bag of Words, TF-IDF
Word Embeddings: Word2Vec, GloVe
Sentiment Analysis
Topic Modeling: LDA
Transformer Models (BERT, GPT - intro)
Data Visualization and Storytelling
Principles of Effective Data Visualization
Dashboards (Tableau / Power BI)
Plotly, Altair, and Streamlit for Interactive Visuals
Communicating Data Insights to Stakeholders
Building Infographics
Big Data & Cloud Platforms
Introduction to Big Data: Characteristics and Use Cases
Hadoop Ecosystem (HDFS, MapReduce)
Apache Spark (PySpark for ML at scale)
Cloud Platforms: AWS (S3, EC2, SageMaker)
Google Cloud (BigQuery)
Azure ML
GST TECHNOLOGY