성능을 유지하면서 모델의 기본 구조를 변경하여 더 적은 파라미터를 사용하거나 더 적은 연산을 사용하는 구조로 변환하는 방법.

Model Compression

학습된 모델의 redundancy를 줄이는 방법. Quantization, Pruning, Weight Factorization, kowledge Distillation, Weight Sharing 등.

lightweight model algorithm 개발하기 위해서는 기존 딥러닝 알고리즘 구조를 이해한 후 구조를 수정해야 하므로 특정 알고리즘마다 새로운 방법을 개발해야 하는 문제가 있음.

그래서 model compression 방법 사용하는거임