대표 실행 명령: ollama run llama3.1
Ollama로 로컬 모델을 내려받고 API 서버를 확인합니다.
ollama pull llama3.1
curl http://localhost:11434/api/tagsOpenAI 호환 API 형태로 로컬 Llama를 연결합니다.
문서를 chunk로 나누고 벡터 검색을 통해 답변 정확도를 높입니다.
토큰 단위 스트리밍으로 응답 체감 속도를 개선합니다.
예제를 실제 서비스에 맞게 바꿀 때는 URL, 인증 정보, 임계값, 리포트 저장 위치를 먼저 분리하세요.
가이드 본문으로 이동 →