[LLM] RTX4060Ti 16GB에서 Qwen3.5 35B-A3B Q3 vs 9B Q4, 뭐가 더 나을까?
홈서버/LLM·2026. 3. 29.
모델 선택의 딜레마보통 Q4가 가장 효율적인 양자화 버전으로 많이 사용된다. 27B가 가장 똑똑하다고 하지만 사실상 Q4 양자화 버전이 초당 16~19토큰밖에 나오질 않는다. 추론이 필요한 경우라면 굉장히 오랜 시간이 걸리기 때문에 실사용에는 어렵다고 판단했다. 최소 초당 30토큰 이상은 나와야 실사용에 문제가 없을 것 같았다. 그러면 여기서 딜레마가 생긴다. 높은 파라미터 모델의 Q3 양자화 버전과 낮은 파라미터 모델의 Q4 양자화 버전 중 뭘 쓰느냐였다. 즉, Qwen3.5 35B-A3B의 Q3 vs Qwen3.5 9B의 Q4 중 뭐가 더 나은지를 비교해보고 싶었다. VRAM이 16GB밖에 되질 않다보니 큰 모델을 쓰려면 양자화를 깎아야 하고, 작은 모델은 양자화를 널널하게 쓸 수 있지만 파라미터수 ..