성능을 유지하면서 모델의 기본 구조를 변경하여 더 적은 파라미터를 사용하거나 더 적은 연산을 사용하는 구조로 변환하는 방법.
학습된 모델의 redundancy를 줄이는 방법. Quantization, Pruning, Weight Factorization, kowledge Distillation, Weight Sharing 등.
lightweight model algorithm 개발하기 위해서는 기존 딥러닝 알고리즘 구조를 이해한 후 구조를 수정해야 하므로 특정 알고리즘마다 새로운 방법을 개발해야 하는 문제가 있음.
그래서 model compression 방법 사용하는거임