본문 바로가기

AI

RTX 4090의 24GB VRAM을 최대한 활용하면서, 대규모 프로젝트의 긴 컨텍스트와 빠른 자동완성을 모두 만족하는 최적의 밸런스 LLM 모델 선정 및 설정 가이드

반응형

현재 구성 vs 개선안
| 역할 | 현재 구성 | **최적화 제안** | 이유 |
|------|----------|----------------|------|
| **ASK** | qwen3-coder:30b-a3b-q4_K_M | **qwen3-coder:30b-a3b-q5_K_M** | VRAM 여유로 더 높은 정밀도 가능 |
| **Edit** | qwen3-coder:30b-a3b-q4_K_M | **qwen3-coder:30b-a3b-q5_K_M** | 위와 동일 |
| **Autocomplete** | qwen3-coder-next:q4_K_M | **qwen2.5-coder:7b-instruct-q8_0** | FIM 특화 + 더 빠른 응답 |
| **General Chat** | qwen3:30b | **qwen3:32b-q4_K_M** | 더 표준적인 사이즈, 커뮤니티 지원 우수 |

## 🔧 상세 설치 가이드

### 1단계: 모델 다운로드

```powershell
# PowerShell 관리자 권한으로 실행

# ASK/Edit용 (Q5_K_M - 더 높은 정밀도)
ollama pull qwen3-coder:30b-a3b-q5_K_M

# Autocomplete용 (FIM 특화, 초고속)
ollama pull qwen2.5-coder:7b-instruct-q8_0

# General Chat용
ollama pull qwen3:32b-q4_K_M
```

> **💡 VRAM 계산:**
> - Qwen3-Coder-30B-A3B Q5_K_M: 약 22GB (24GB에 맞춤)
> - Qwen2.5-Coder-7B Q8_0: 약 8GB (가볍고 빠름)
> - Qwen3-32B Q4_K_M: 약 20GB (여유로움)

---

### 2단계: VS Code Continue 설정

`%USERPROFILE%\.continue\config.json` 파일 열기 (또는 Continue 설정에서 열기)

```json
{
  "models": [
    {
      "title": "Qwen3-Coder ASK/Edit",
      "provider": "ollama",
      "model": "qwen3-coder:30b-a3b-q5_K_M",
      "apiBase": "http://localhost:11434",
      "completionOptions": {
        "temperature": 0.1,
        "num_ctx": 32768
      }
    },
    {
      "title": "Qwen2.5-Coder Autocomplete",
      "provider": "ollama",
      "model": "qwen2.5-coder:7b-instruct-q8_0",
      "apiBase": "http://localhost:11434",
      "roles": ["autocomplete"],
      "completionOptions": {
        "temperature": 0.0,
        "num_ctx": 8192
      }
    },
    {
      "title": "Qwen3 General Chat",
      "provider": "ollama",
      "model": "qwen3:32b-q4_K_M",
      "apiBase": "http://localhost:11434",
      "completionOptions": {
        "temperature": 0.7,
        "num_ctx": 16384
      }
    }
  ],
  "tabAutocompleteModel": {
    "title": "Qwen2.5-Coder Autocomplete",
    "provider": "ollama",
    "model": "qwen2.5-coder:7b-instruct-q8_0",
    "apiBase": "http://localhost:11434"
  }
}
```

---

### 3단계: OpenClaw/Codex 설정

OpenClaw 또는 Codex(아마 Cursor/Cline/OpenHands 유사 도구)의 설정 파일에서:

```yaml
# .openclaw/config.yaml 또는 유사 파일
models:
  ask:
    provider: ollama
    model: qwen3-coder:30b-a3b-q5_K_M
    base_url: http://localhost:11434
    context_length: 32768
  
  edit:
    provider: ollama
    model: qwen3-coder:30b-a3b-q5_K_M
    base_url: http://localhost:11434
    context_length: 32768
  
  autocomplete:
    provider: ollama
    model: qwen2.5-coder:7b-instruct-q8_0
    base_url: http://localhost:11434
    context_length: 8192
  
  chat:
    provider: ollama
    model: qwen3:32b-q4_K_M
    base_url: http://localhost:11434
    context_length: 16384
```

---

## 🚀 대규모 프로젝트 최적화 팁

### 1. 컨텍스트 길이 설정

대규모 React·Java 프로젝트는 파일이 많고 코드가 길므로 **num_ctx를 충분히 크게** 설정하세요.

```powershell
# Ollama 전역 설정 (선택사항)
# C:\Users\<사용자>\.ollama\config.json 생성
{
  "OLLAMA_NUM_PARALLEL": 2,
  "OLLAMA_MAX_LOADED_MODELS": 2
}
```

### 2. 모델 로딩 전략

RTX 4090 24GB에 **동시에 2개 모델**을 올릴 수 있습니다.

```powershell
# 자주 쓰는 모델 2개 미리 로드
ollama run qwen3-coder:30b-a3b-q5_K_M "loaded"
# 다른 터미널에서
ollama run qwen2.5-coder:7b-instruct-q8_0 "loaded"
```

### 3. 프로젝트 특화 프롬프트

`.continue/prompts/` 폴더에 프로젝트별 프롬프트 생성:

**`react-expert.md`**:
```markdown
You are an expert React developer specializing in:
- React 18+ with TypeScript
- Next.js 14+ App Router
- State management (Zustand, Redux Toolkit)
- Tailwind CSS and shadcn/ui

Always provide:
- TypeScript types
- Error handling
- Performance optimizations (useMemo, useCallback)
```

**`java-expert.md`**:
```markdown
You are an expert Java developer specializing in:
- Java 21+ with Spring Boot 3.x
- JPA/Hibernate optimization
- Microservices architecture
- Testing (JUnit 5, Mockito)

Always provide:
- Proper exception handling
- Transaction management
- Security considerations
```

---

## 📈 성능 비교

| 모델 | VRAM 사용 | 응답 속도 | 코딩 성능 | 추천도 |
|------|----------|----------|----------|--------|
| Qwen3-Coder-30B-A3B Q5_K_M | ~22GB | 빠름 | ⭐⭐⭐⭐⭐ | ASK/Edit |
| Qwen2.5-Coder-7B Q8_0 | ~8GB | 매우 빠름 | ⭐⭐⭐⭐ | Autocomplete |
| Qwen3-32B Q4_K_M | ~20GB | 빠름 | ⭐⭐⭐⭐ | General Chat |

---

## ✅ 최종 권장 구성

```
ASK/Edit:      qwen3-coder:30b-a3b-q5_K_M  (최고 정밀도)
Autocomplete:  qwen2.5-coder:7b-instruct-q8_0  (FIM 특화, 초고속)
General Chat:  qwen3:32b-q4_K_M  (안정적, 범용적)
```


반응형