한 줄 요약: 자기 기기에서 모델을 돌리면 자료를 밖으로 보내지 않아도 됩니다. 다만 되는 것과 쓸 만한 것은 다르므로 미리 볼 것이 있습니다.
참고 출처: findarepo 로컬 AI 도구 목록
왜 로컬을 보게 되나
- 자료를 밖으로 안 보냅니다. 계약서나 개인정보가 든 문서를 다룰 때 이유가 됩니다.
- 사용량 한도가 없습니다. 기기가 버티는 만큼 씁니다.
- 인터넷이 끊겨도 됩니다.
- 비용이 고정입니다. 쓴 만큼 내는 방식이 아닙니다.
확인할 3가지
- 메모리 — 모델 크기가 기기 메모리를 넘으면 아예 안 뜨거나 극도로 느려집니다. 양자화된 작은 버전부터 시험합니다.
- 속도 — GPU 없이 돌리면 응답이 초 단위가 아니라 수십 초가 될 수 있습니다. 대화형에는 답답하고, 밤새 돌리는 일괄 처리에는 괜찮습니다.
- 품질 차이 — 같은 이름이어도 작은 버전은 결과가 다릅니다. 요약은 쓸 만해도 추론이 필요한 일은 어렵습니다.
먼저 시험해 볼 작업
로컬이 유리한 일과 불리한 일이 갈립니다.
- 유리 — 문서 요약, 분류, 형식 변환처럼 정답 범위가 좁은 일.
- 유리 — 같은 작업을 대량으로 반복하는 일.
- 불리 — 긴 추론이나 최신 정보가 필요한 일.
- 불리 — 즉시 응답이 필요한 대화.
시작하는 순서
- 가장 작은 모델로 설치와 실행부터 확인합니다. 여기서 막히는 경우가 많습니다.
- 내 실제 문서 한 건으로 결과 품질을 봅니다. 예제 문서는 잘 되게 되어 있습니다.
- 처리 시간을 재 둡니다. 100건이면 몇 시간인지 계산이 됩니다.
- 쓸 만하면 한 단계 큰 모델로 올려 비교합니다.
순서를 건너뛰고 큰 모델부터 받으면, 안 돌아가는 이유가 기기 때문인지 설정 때문인지 구분이 안 됩니다.
로컬로 돌릴 때 자주 나오는 오해
- "로컬이니까 무료다" — 전기와 시간은 듭니다. 대량 처리라면 계산해 볼 만합니다.
- "모델만 받으면 된다" — 실행 도구, 양자화 버전, 설정이 함께 맞아야 합니다.
- "성능이 같다" — 이름이 같아도 작은 버전은 결과가 다릅니다.
- "안전하다" — 자료가 밖으로 안 나가는 것과 결과가 정확한 것은 다른 문제입니다.
기기별로 기대할 수 있는 수준
정확한 수치는 기기와 모델에 따라 달라지지만, 판단 기준은 단순합니다.
- 메모리가 넉넉하면 더 큰 모델이 올라가고 결과가 좋아집니다.
- 메모리가 부족하면 실행 자체가 안 되거나 디스크를 오가며 극도로 느려집니다.
- GPU가 없으면 속도가 문제이지 되고 안 되고의 문제는 아닌 경우가 많습니다.
- 발열과 배터리도 고려합니다. 노트북에서 장시간 돌리면 성능이 떨어집니다.
그래서 먼저 재 볼 것은 정확도가 아니라 한 건 처리에 걸리는 시간입니다. 그 값으로 실제 쓸 수 있는 작업인지가 갈립니다.
읽고 나서 확인할 것
별 수와 순위는 게시 시점의 공개 집계 기준이며 계속 바뀝니다. 도입 전에는 라이선스와 최신 저장소 상태를 직접 확인하세요.