본문으로 건너뛰기

RTX 3090 ×2 기반 Qwen3.8-27B Q8 로컬 Coding Agent 실증

· 약 5분
이승익 책임연구원
AIoT 융합 플랫폼 그룹

로컬 GPU 인프라를 활용한 생성형 AI 개발환경의 실용성을 검증하기 위해 Qwen3.8-27B 기반 Coding Agent 환경을 구성하고, 토이 프로젝트 형태로 실제 웹 게임 개발을 진행하였습니다. 최근 바이브 코딩으로 불리는 AI 기반 개발 방식의 실용 가능성을 확인하고, 온프레미스 인프라 환경에서 Coding Agent 기반 개발환경의 활용 가능성을 검토하였습니다.


1. 로컬 Coding Agent 실증 결과

다중 파일 생성·수정, 기능 간 연계, 빌드 오류 분석 및 반복 수정 등 Coding Agent의 개발 수행 능력을 확인하기 위한 토이 프로젝트로 Three.js와 WebGPU 기반의 3D 웹 게임(3D Galaga 스타일)을 구현하였습니다.

Qwen3.8-27B Q8 모델을 LM Studio에 구축하고, VS Code Built-in Agent와 Custom Endpoint 방식으로 연계하여 Three.js, WebGPU, JavaScript, Vite 기반의 프로젝트를 개발하였습니다.

3D Galaga 실행 화면

3D Galaga 실행 화면 ※ 약 8시간의 개발 및 수정 작업을 거쳐 구현된 토이 프로젝트 결과물입니다.

직접 실행해보기

👉 3D Galaga 실행하기

GitHub Repository

👉 https://github.com/grit-docs/3d-galaga

단순한 일회성 코드 생성을 넘어, VS Code Agent가 프로젝트 파일을 직접 생성·수정하고 오류를 분석하여 보완하는 다중 파일 기반 실증 작업을 수행하였습니다.

개발 환경 구성은 다음과 같습니다.

VS Code Built-in Agent

Custom Endpoint

LM Studio

Qwen3.8-27B Q8

NVIDIA RTX 3090 24GB ×2

실제 프로젝트를 진행한 결과, 단순한 코드 생성 속도 외에도 여러 파일 간의 참조 관계와 이전 작업 맥락을 안정적으로 유지하며 수정할 수 있는지가 Coding Agent 환경의 핵심적인 요소로 확인되었습니다.


2. 테스트 시스템 및 모델 구성

이번 실증에 사용한 시스템 사양 및 모델 설정은 다음과 같습니다.

항목구성
CPUIntel Core i9-11900K
RAM64GB
GPUNVIDIA RTX 3090 24GB ×2
Base ModelQwen3.8-27B
QuantizationQ8
최대 컨텍스트 길이262,144 tokens (256K)
설정 컨텍스트 길이180,224 tokens (176K)
Reasoning EffortMedium
InferenceLM Studio
IDE / AgentVS Code Built-in Agent

RTX 3090 24GB 두 장을 이용하여 Qwen3.8-27B Q8 모델을 구동하였습니다.

듀얼 GPU 모델 로딩 상태

LM Studio에서 컨텍스트 길이를 180,224 tokens(176K)로 설정한 상태에서 RTX 3090 두 장에 모델이 분산 적재되었으며, GPU 0 약 19.0GB, GPU 1 약 20.4GB의 VRAM 점유를 확인하였습니다.

듀얼 GPU 모델 로딩 상태


3. Qwen3.8-27B 공식 코딩·에이전트 벤치마크

Hugging Face의 Qwen/Qwen3.8-27B 모델 카드에 발표된 공식 벤치마크에 따르면, 주요 코딩 및 에이전트 평가에서 Claude Opus 4.6 Max를 포함한 상용·오픈 모델들과 비교하여 다음과 같은 성능을 기록하였습니다.

벤치마크Qwen3.8-27BClaude Opus 4.6 Max평가 내용
LiveCodeBench v690.388.8최신 코딩 및 알고리즘 문제 해결
OSWorld-Verified84.372.7컴퓨터 환경에서의 에이전트 작업 수행
IFBench79.562.5지시사항 준수 능력
Terminal-Bench 2.173.078.2터미널 환경의 에이전틱 코딩
SWE-bench Pro61.753.4실제 소프트웨어 엔지니어링 문제 해결
DeepSWE 1.142.2-에이전틱 소프트웨어 엔지니어링

※ 상기 수치는 Qwen에서 공개한 Qwen3.8-27B 원본 모델의 공식 벤치마크 결과이며, 본 테스트에서 사용한 Q8 양자화 모델의 직접 측정 결과는 아닙니다.


4. Qwen3.8-27B Q8 직접 생성 성능

Coding Agent 환경에서의 모델 성능을 검증하기 위해, 외부 Context(Workspace 정보, 시스템 프롬프트 등)의 변수를 분리하고 LM Studio REST API를 직접 호출하여 모델의 순수 토큰 생성 속도를 측정하였습니다.

테스트 프롬프트 및 API 호출 스크립트

충분한 양의 토큰 생성을 유도하기 위해 FastAPI 기반의 REST API 코드 작성을 요청하였으며, 최대 2,000 tokens를 생성하도록 설정하여 PowerShell로 LM Studio REST API를 호출하였습니다.

$body = @{
model = "qwen/qwen3.8-27b"
input = @"
Python FastAPI REST API 예제를 작성해줘.
사용자 CRUD, SQLite, SQLAlchemy, Pydantic을 포함하고
설명은 최소화해서 긴 코드 중심으로 작성해.
"@
temperature = 0.2
max_output_tokens = 2000
} | ConvertTo-Json -Depth 10

$result = Invoke-RestMethod `
-Uri "http://<LM_STUDIO_SERVER_IP>:1234/api/v1/chat" `
-Method Post `
-ContentType "application/json" `
-Body $body

$result.stats

측정 결과

동일한 조건으로 총 3회 반복 측정한 결과는 다음과 같습니다.

테스트생성 속도TTFT
1차67.71 tok/s1.240초
2차65.63 tok/s1.229초
3차67.27 tok/s1.161초
평균66.87 tok/s1.21초

※ 본 수치는 LM Studio REST API를 직접 호출하여 측정한 모델의 순수 토큰 생성 속도입니다.

첫 번째 토큰이 출력되기까지 걸리는 시간인 TTFT(Time To First Token)는 평균 약 1.21초로 측정되었습니다.

체감 속도

평균 66.87 tok/s를 기준으로 토큰 출력량에 따른 소요 시간을 환산하면 다음과 같습니다.

출력량예상 생성 시간
500 tokens약 7.5초
1,000 tokens약 15초
2,000 tokens약 30초
4,000 tokens약 60초

일반적인 코드 생성 작업에서 활용 가능한 수준의 생성 속도를 확인하였습니다.

물론 실제 Coding Agent 워크플로에서는 모델의 코드 생성 외에도 Workspace 분석, 긴 Context 처리, Tool Call 실행, 파일 시스템 수정, 빌드 검증 등의 단계가 포함되므로 전체 작업 소요 시간은 추가될 수 있습니다.


5. 활용 가능성 및 시사점

이번 실증을 통해 RTX 3090 ×2 기반의 기존 GPU 자원을 활용하여 27B급 로컬 LLM Coding Agent 환경을 구축하고, 실제 코드 개발 업무에 적용할 수 있는 가능성을 확인하였습니다.

  • 기존 GPU 자원을 활용한 로컬 LLM 환경 구성 가능성: NVIDIA RTX 3090 24GB ×2 구성을 활용하여 Qwen3.8-27B Q8 모델을 온프레미스 환경에서 구동할 수 있음을 확인하였으며, 별도의 고가 GPU 서버 없이도 로컬 Coding Agent 환경을 구성할 수 있는 가능성을 검증하였습니다.
  • 코드 생성 업무에 활용 가능한 추론 성능 확인: REST API 기반 성능 측정 결과, 순수 생성 속도는 평균 66.87 tok/s, 첫 번째 토큰이 출력되기까지의 TTFT는 평균 약 1.21초로 나타났습니다. 이를 통해 일반적인 코드 생성·수정 및 Agent 기반 개발 작업에 활용 가능한 수준의 응답 성능을 확인하였습니다.
  • 다중 파일 기반 Coding Agent 적용 가능성 검증: 다중 파일 구조의 토이 프로젝트를 대상으로 파일 간 참조관계 이해, Context 유지, Tool Call 수행 및 반복 수정 능력을 검증하였으며, 이를 통해 실제 소프트웨어 개발환경에서의 Coding Agent 활용 가능성을 확인하였습니다.

결과물