가중치를 두어서 평균을 내리는 것.

장점
- 파라미터가 줄어서 추론 속도가 빨라진다.
- Regularization(모델 복잡도를 줄인다)이 일반화 성능을 높인다.
단점
- 정보 손실
- 너무 sparse하게 만들면 하드웨어 가속 효율이 떨어진다.

별로 의미가 없다고 여겨지는 0주위의 정보들을 잘라냄. (outline이 10^5 → 10^4)
dropout과 차이점
- dropout은 앙상블 효과. 어떤 뉴런을 하나 끄고 학습할 때마다 서로 다른 structure의 네트워크를 여러 개 중복해서 학습하는 효과.
- pruning은 한번 잘라낸 뉴런 보관 안함. 그러나 dropout은 regularization이 목적이므로 학습 시에 뉴런 랜덤으로 껐다가 다시 켜는 과정 반복. 추론 시에는 모든 뉴런 킴.
pruning은 한번에 수행되지 않고, 가지치기 이후 retraining(fine tuning)과정을 몇번씩 거친다. 한번에 수행되면 weight들이 다 잘려나가 성능이 급격히 떨어진다. 그보다는, 여러번 반복하여 성능을 복원했다가 조금씩 pruning하는 방법이 주로 사용된다.