현재 구성 vs 개선안
| 역할 | 현재 구성 | **최적화 제안** | 이유 |
|------|----------|----------------|------|
| **ASK** | qwen3-coder:30b-a3b-q4_K_M | **qwen3-coder:30b-a3b-q5_K_M** | VRAM 여유로 더 높은 정밀도 가능 |
| **Edit** | qwen3-coder:30b-a3b-q4_K_M | **qwen3-coder:30b-a3b-q5_K_M** | 위와 동일 |
| **Autocomplete** | qwen3-coder-next:q4_K_M | **qwen2.5-coder:7b-instruct-q8_0** | FIM 특화 + 더 빠른 응답 |
| **General Chat** | qwen3:30b | **qwen3:32b-q4_K_M** | 더 표준적인 사이즈, 커뮤니티 지원 우수 |
## 🔧 상세 설치 가이드
### 1단계: 모델 다운로드
```powershell
# PowerShell 관리자 권한으로 실행
# ASK/Edit용 (Q5_K_M - 더 높은 정밀도)
ollama pull qwen3-coder:30b-a3b-q5_K_M
# Autocomplete용 (FIM 특화, 초고속)
ollama pull qwen2.5-coder:7b-instruct-q8_0
# General Chat용
ollama pull qwen3:32b-q4_K_M
```
> **💡 VRAM 계산:**
> - Qwen3-Coder-30B-A3B Q5_K_M: 약 22GB (24GB에 맞춤)
> - Qwen2.5-Coder-7B Q8_0: 약 8GB (가볍고 빠름)
> - Qwen3-32B Q4_K_M: 약 20GB (여유로움)
---
### 2단계: VS Code Continue 설정
`%USERPROFILE%\.continue\config.json` 파일 열기 (또는 Continue 설정에서 열기)
```json
{
"models": [
{
"title": "Qwen3-Coder ASK/Edit",
"provider": "ollama",
"model": "qwen3-coder:30b-a3b-q5_K_M",
"apiBase": "http://localhost:11434",
"completionOptions": {
"temperature": 0.1,
"num_ctx": 32768
}
},
{
"title": "Qwen2.5-Coder Autocomplete",
"provider": "ollama",
"model": "qwen2.5-coder:7b-instruct-q8_0",
"apiBase": "http://localhost:11434",
"roles": ["autocomplete"],
"completionOptions": {
"temperature": 0.0,
"num_ctx": 8192
}
},
{
"title": "Qwen3 General Chat",
"provider": "ollama",
"model": "qwen3:32b-q4_K_M",
"apiBase": "http://localhost:11434",
"completionOptions": {
"temperature": 0.7,
"num_ctx": 16384
}
}
],
"tabAutocompleteModel": {
"title": "Qwen2.5-Coder Autocomplete",
"provider": "ollama",
"model": "qwen2.5-coder:7b-instruct-q8_0",
"apiBase": "http://localhost:11434"
}
}
```
---
### 3단계: OpenClaw/Codex 설정
OpenClaw 또는 Codex(아마 Cursor/Cline/OpenHands 유사 도구)의 설정 파일에서:
```yaml
# .openclaw/config.yaml 또는 유사 파일
models:
ask:
provider: ollama
model: qwen3-coder:30b-a3b-q5_K_M
base_url: http://localhost:11434
context_length: 32768
edit:
provider: ollama
model: qwen3-coder:30b-a3b-q5_K_M
base_url: http://localhost:11434
context_length: 32768
autocomplete:
provider: ollama
model: qwen2.5-coder:7b-instruct-q8_0
base_url: http://localhost:11434
context_length: 8192
chat:
provider: ollama
model: qwen3:32b-q4_K_M
base_url: http://localhost:11434
context_length: 16384
```
---
## 🚀 대규모 프로젝트 최적화 팁
### 1. 컨텍스트 길이 설정
대규모 React·Java 프로젝트는 파일이 많고 코드가 길므로 **num_ctx를 충분히 크게** 설정하세요.
```powershell
# Ollama 전역 설정 (선택사항)
# C:\Users\<사용자>\.ollama\config.json 생성
{
"OLLAMA_NUM_PARALLEL": 2,
"OLLAMA_MAX_LOADED_MODELS": 2
}
```
### 2. 모델 로딩 전략
RTX 4090 24GB에 **동시에 2개 모델**을 올릴 수 있습니다.
```powershell
# 자주 쓰는 모델 2개 미리 로드
ollama run qwen3-coder:30b-a3b-q5_K_M "loaded"
# 다른 터미널에서
ollama run qwen2.5-coder:7b-instruct-q8_0 "loaded"
```
### 3. 프로젝트 특화 프롬프트
`.continue/prompts/` 폴더에 프로젝트별 프롬프트 생성:
**`react-expert.md`**:
```markdown
You are an expert React developer specializing in:
- React 18+ with TypeScript
- Next.js 14+ App Router
- State management (Zustand, Redux Toolkit)
- Tailwind CSS and shadcn/ui
Always provide:
- TypeScript types
- Error handling
- Performance optimizations (useMemo, useCallback)
```
**`java-expert.md`**:
```markdown
You are an expert Java developer specializing in:
- Java 21+ with Spring Boot 3.x
- JPA/Hibernate optimization
- Microservices architecture
- Testing (JUnit 5, Mockito)
Always provide:
- Proper exception handling
- Transaction management
- Security considerations
```
---
## 📈 성능 비교
| 모델 | VRAM 사용 | 응답 속도 | 코딩 성능 | 추천도 |
|------|----------|----------|----------|--------|
| Qwen3-Coder-30B-A3B Q5_K_M | ~22GB | 빠름 | ⭐⭐⭐⭐⭐ | ASK/Edit |
| Qwen2.5-Coder-7B Q8_0 | ~8GB | 매우 빠름 | ⭐⭐⭐⭐ | Autocomplete |
| Qwen3-32B Q4_K_M | ~20GB | 빠름 | ⭐⭐⭐⭐ | General Chat |
---
## ✅ 최종 권장 구성
```
ASK/Edit: qwen3-coder:30b-a3b-q5_K_M (최고 정밀도)
Autocomplete: qwen2.5-coder:7b-instruct-q8_0 (FIM 특화, 초고속)
General Chat: qwen3:32b-q4_K_M (안정적, 범용적)
```
'AI' 카테고리의 다른 글
| 로컬 LLM 구축을 위한 내 PC 정보 알아보기 (0) | 2026.07.31 |
|---|---|
| 레거시 React 프로젝트를 Windows 11에서 안정적으로 개발하기 위한 환경 (0) | 2026.07.27 |
| 기존 LLM 학습 자산의차세대 LLM으로의마이그레이션 전략 (0) | 2026.07.27 |
| 개인 또는 회사 내부 AI LLM 구축 과정 정리 (0) | 2026.07.26 |
| Orca IDE에서 Ollama의 Qwen3-Coder를 직접 사용하는 방법 (0) | 2026.07.26 |