Configuration options
Load target options (use as
--load-targets <key>=<value>[,<key>=<value>...]):
default=<Fraction>- General load target from 0 to 1tokens_generated_per_second=<Integer>- Desired tokens per second per replicaprompt_tokens_per_second=<Integer>- Desired prompt tokens per second per replicarequests_per_second=<Number>- Desired requests per second per replicaconcurrent_requests=<Number>- Desired concurrent requests per replica
Common patterns
- Cost optimization
- Performance-focused
- Predictable traffic
Scale to zero when idle to minimize costs:Best for: Development, testing, or intermittent production workloads.
Scaling from zero behavior
When a deployment is scaled to zero and receives a request, the system immediately returns a503 error with the DEPLOYMENT_SCALING_UP error code while initiating the scale-up process:
Handling scale-from-zero responses
Implement retry logic with exponential backoff to gracefully handle scale-up delays:- Python
- JavaScript
- curl
Deployments with min replicas = 0 are auto-deleted after 7 days of no traffic. Reserved capacity guarantees availability during scale-up.