Skip to content
mlmentorship

Book VIII · Chapter 1

Vision and multimodal foundations

Build from convolution to residual and transformer models, then study transfer and robustness.

Priority
Specialist
Difficulty
Intermediate
Useful for
Vision, Multimodal, AS, RS
Interview rounds
ML breadth, Research

Read first: Neural network foundations

Chapter contents

7 entries · read in order
  1. 01
    Convolution as matrix multiplication (im2col)
    Concept
  2. 02
    CNN architecture
    Concept
  3. 03
    ResNet
    Concept
  4. 04
    Vision transformers (ViT)
    Concept
  5. 05
    Domain adaptation
    Concept
  6. 06
    Adversarial robustness
    Concept
  7. 07
    Multimodal foundation models
    Concept