차세대 컴퓨팅 인프라
베어메탈 하드웨어부터 컨테이너 오케스트레이션까지, 까다로운 워크로드를 위해 계층별로 최적화된 컴퓨팅 환경을 제공합니다.
서버리스 스케줄링
실시간 트래픽에 맞춰 인스턴스를 확장하고 유휴 용량을 줄이며 수요 변화 속에서도 추론 엔드포인트 응답성을 유지합니다.
저지연 추론 가속
최적화된 TensorRT 및 vLLM 런타임 경로가 일반 서빙 스택 대비 처리량과 응답 시간을 개선합니다.
Terminal
1// High-throughput inference with vLLM2from vllm import LLM, SamplingParams34prompts = ["Explain quantum computing in 100 words."]5sampling_params = SamplingParams(temperature=0.8, top_p=0.95)67llm = LLM(model="llama-3-70b-instruct", tensor_parallel_size=4)8outputs = llm.generate(prompts, sampling_params)서버리스 스케줄링
실시간 트래픽에 맞춰 인스턴스를 확장하고 유휴 용량을 줄이며 수요 변화 속에서도 추론 엔드포인트 응답성을 유지합니다.
저지연 추론 가속
최적화된 TensorRT 및 vLLM 런타임 경로가 일반 서빙 스택 대비 처리량과 응답 시간을 개선합니다.
글로벌 액티브-액티브 배포
지역 컴퓨팅 풀과 중복성이 고동시성 트래픽 급증 중에도 추론 서비스를 안정적으로 유지하도록 돕습니다.
추천 컴퓨팅 프로파일
이 워크로드에 맞춰 성능, 효율, 제공 준비 상태의 균형을 맞춘 GPU 프로파일을 선택했습니다.

