Fastly AI Accelerator : LLM 응답을 캐싱해 성능과 비용을 동시에 줄이는 방법
대형 언어 모델(LLM)은 이제 다양한 서비스에서 핵심 역할을 하고 있지만, 한 가지 현실적인 문제가 있습니다.
LLM API 호출은 느리고 비싸다.
Fastly의 AI Accelerator는 바로 이 문제를 해결하기 위해 만들어진 솔루션입니다.
LLM API 응답을 캐싱하고, 의미적으로 유사한 요청까지 캐싱해 재사용함으로써:
- 지연 시간(latency)을 줄이고
- LLM API 호출 비용을 절감할 수 있게 합니다.
이 포스트에서는 AI Accelerator의 기능, 설정 방법, 헤더 활용, 캐시 관리 방법까지 한 번에 정리합니다.
1. AI Accelerator란?
AI Accelerator는 OpenAI를 비롯한 여러 AI 서비스의 LLM 응답을 캐싱하는 솔루션입니다.
특징은 다음과 같습니다:
- LLM 응답 캐싱
- Semantic Cache(의미 기반 캐싱) 지원
- OpenAI, Azure OpenAI, Google Gemini 등 지원
- LLM API 비용 절감
- Latency 단축
유사한 질의가 들어오면 의미적 유사도를 계산하고, 임계값을 넘으면 캐싱된 응답을 재사용합니다.
2. 사전 준비 사항
AI Accelerator를 활성화하기 위해 필요한 것은 다음뿐입니다:
- Fastly 계정 로그인
- superuser 권한
Superuser가 액세스하면 Fastly UI에서 기능을 활성화할 수 있고, 활성화 후에는 모든 계정 사용자가 지표를 볼 수 있습니다.
3. 지원되는 LLM 목록
현재 AI Accelerator가 지원하는 모델은 다음과 같습니다:
- OpenAI
- Azure OpenAI
- Gemini
- OpenAI 호환 API 기반 LLM
즉, 대부분의 주요 LLM이 포함됩니다.
4. AI Accelerator 활성화 방법
Fastly UI에서 다음 순서로 클릭하면 됩니다:
- Fastly Control Panel 로그인
- Tools > AI Accelerator
- Enable AI Accelerator 클릭
- “Enable Now” 클릭
이제 계정에서 사용 가능해집니다.
5. 애플리케이션 설정 방법
AI Accelerator 활성화 후에는
애플리케이션이 Fastly AI Accelerator 엔드포인트를 사용하도록 코드를 수정해야 합니다.
OpenAI / OpenAI-compatible API 예제 (JS)
import OpenAI from "openai";
const openai = new OpenAI({
apiKey: request.env.OPENAI_API_KEY,
baseURL: "https://ai.fastly.app/api.openai.com/v1",
defaultHeaders: {
"Fastly-Key": `<FASTLY-KEY>`,
},
});
Azure OpenAI 예제 (Python)
from openai.lib.azure import AzureOpenAI
client = AzureOpenAI(
api_key=azure_key,
api_version="2024-06-01",
azure_deployment="ai-member-4o-chat",
azure_endpoint=f"https://ai.fastly.app/<AZURE RESOURCE>.openai.azure.com",
default_headers = {
"Fastly-Key": f"<FASTLY-KEY>",
}
)
Google Gemini 예제 (JS)
const {VertexAI} = require('@google-cloud/vertexai');
async function generate_from_text_input(projectId = '<GCP-PROJECT_ID>') {
const vertexAI = new VertexAI({project: projectId, location: '<GCP-PROJECT-REGION>'});
const generativeModel = vertexAI.getGenerativeModel({
model: 'gemini-1.5-flash-001',
});
const prompt =
"What's a good name for a flower shop that specializes in selling bouquets of dried flowers?";
const resp = await generativeModel.generateContent(prompt);
const contentResponse = await resp.response;
console.log(JSON.stringify(contentResponse));
}
6. 캐시 동작을 제어하는 헤더들
AI Accelerator는 요청/응답 헤더를 통해 캐싱 동작을 설정할 수 있습니다.
요청 헤더
| 헤더 | 설명 |
| x-semantic-threshold | Semantic cache 유사도 기준(기본 0.75). 낮출수록 캐시 HIT 가능성 ↑ |
| x-semantic-cache-key | 캐시를 구분하는 사용자 정의 키 (기본값: _default_) |
| x-settings-overrides | semantic cache 사용 여부 (기본: {"semantic_cache_enabled": true}) |
| Cache-Control: max-age | 캐시 TTL 설정 가능. 최대 30일 |
응답 헤더
| 헤더 | 설명 |
| x-semantic-cache | HIT 또는 MISS 로 캐시 여부 표시 (이전 명칭: x-cache) |
7. AI Accelerator 페이지에서 제공되는 지표(Metrics)
Fastly UI의 AI Accelerator 페이지에서는 다음 지표를 확인할 수 있습니다.
Total requests
계정 전체에서 Accelerator로 들어온 요청 수
Tokens served from cache
캐시에서 제공된 토큰의 추정량
(LLM 토큰 단위는 모델마다 다름)
Estimated time saved
캐시 HIT 덕분에 절약된 시간을 “분 단위”로 추정
Requests chart
요청량 변화 그래프
Tokens chart
캐시/원본에서 제공된 토큰 수
Origin Latency Percentiles
원본 LLM API를 호출했을 때의 지연 시간 분포
LLM 비용 절약 및 성능 개선 효과를 바로 확인할 수 있다는 점이 장점입니다.
마무리: 비용 절감 + 성능 향상, 두 마리 토끼를 잡는 방법
AI Accelerator는 다음과 같은 팀에 매우 큰 이점을 제공합니다:
- LLM 호출량이 많은 서비스
- Chatbot, 검색, 개인화 기능을 운영하는 기업
- 비용 최적화가 중요한 스타트업
- Latency에 민감한 글로벌 서비스
LLM이 비싸고 느리다는 단점을 캐싱과 의미적 유사도 검색으로 해결한 Fastly의 강력한 솔루션이라 할 수 있습니다.
자세한 내용은 패스틀리의 공식 문서 에서 확인하실 수 있습니다. 긴글 읽어 주셔서 감사합니다.
'Fastly_CDN > CDN_설정' 카테고리의 다른 글
| 패스틀리(Fastly), Stale Content 제공하기 (0) | 2025.12.09 |
|---|---|
| 패스틀리(Fastly), 캐시 포이즈닝(Cache Poisoning) 방지에 대해서 (0) | 2025.12.05 |
| 패스틀리(Fastly), Cache Key조작에 대해서 (0) | 2025.11.26 |
| 패스틀리(Fastly), Segmented Caching의 이용 (0) | 2025.11.12 |
| 패스틀리(Fastly), 캐싱 베스트 프랙티스 정리 (0) | 2025.10.28 |