# Parasail

## Parasail

- [Welcome](https://docs.parasail.io/parasail-docs/readme.md): Parasail provides affordable, high-performance cloud GPUs for running demanding AI workloads—serverless inference, dedicated instances, and batch processing.
- [Serverless](https://docs.parasail.io/parasail-docs/quickstart/serverless.md): Make your first serverless inference call in under two minutes using the OpenAI SDK.
- [Dedicated Instances](https://docs.parasail.io/parasail-docs/quickstart/dedicated.md): Deploy your own model on a dedicated GPU instance in a few minutes.
- [Batch Processing](https://docs.parasail.io/parasail-docs/quickstart/batch.md): Submit your first batch job in five lines of Python. Batch processing is 50% off serverless pricing.
- [Serverless](https://docs.parasail.io/parasail-docs/products/overview.md): Our Serverless Service offers API based on Token Usage with Popular Models.
- [Model-specific Notes](https://docs.parasail.io/parasail-docs/products/overview/model-specific-notes.md): Model-specific Serverless parameters for DeepSeek V3.1, Qwen3.5, and GPT-OSS models on Parasail.
- [Responses API](https://docs.parasail.io/parasail-docs/products/overview/responses-api.md): Use the OpenAI Responses API for multi-turn, agentic workflows with built-in tool calling.
- [Dedicated Instances](https://docs.parasail.io/parasail-docs/products/overview-1.md): Deploy any Hugging Face model on a private GPU endpoint with full control over hardware, scaling, and latency.
- [Speculative Decoding](https://docs.parasail.io/parasail-docs/products/overview-1/speculative-decoding.md): Speed up dedicated models 1.5-2x by adding a draft model for speculative decoding on the same GPU.
- [Private HuggingFace Models](https://docs.parasail.io/parasail-docs/products/overview-1/private-hf-models.md): How to create a dedicated deployment for a private HuggingFace model
- [Management API](https://docs.parasail.io/parasail-docs/products/overview-1/management-api.md): Deploy, pause, resume, scale, and monitor dedicated endpoints programmatically with the Parasail REST API.
- [FP8 Quantization](https://docs.parasail.io/parasail-docs/products/overview-1/fp8-quantization.md): Quantize dedicated models to FP8 with llm-compressor to halve memory use and speed up inference with minimal accuracy loss.
- [Auto-Scaling](https://docs.parasail.io/parasail-docs/products/overview-1/auto-scaling.md): Configure auto-scaling for dedicated endpoints using max concurrent requests, target concurrency, and smoothing factor.
- [Dedicated Serverless](https://docs.parasail.io/parasail-docs/products/capacity.md): Understand the concurrency limits and max requests per minute that govern autoscaling capacity on Dedicated Serverless endpoints.
- [Batch](https://docs.parasail.io/parasail-docs/products/quickstart.md): Get started with Parasail's Batch Processing through the UI or the OpenAI-compatible Python batch helper library.
- [Batch File Format](https://docs.parasail.io/parasail-docs/products/quickstart/file-format.md): Format batch input and output .jsonl files for Parasail's OpenAI-compatible Batch API.
- [Troubleshooting](https://docs.parasail.io/parasail-docs/products/quickstart/troubleshooting.md): Diagnose and fix common batch job failures, from JSONL validation errors to quota and authentication issues.
- [Image Generation](https://docs.parasail.io/parasail-docs/products/overview-2.md): Run diffusion models for batch image generation and editing with Parasail.
- [Authentication](https://docs.parasail.io/parasail-docs/api-reference/authentication.md): API key creation, base URLs, and authentication for the Parasail API.
- [Chat Completions](https://docs.parasail.io/parasail-docs/api-reference/chat-completions.md): OpenAI-compatible chat completions API for serverless and dedicated model inference.
- [Responses API](https://docs.parasail.io/parasail-docs/api-reference/responses-api.md): Responses API reference for multi-turn agentic workflows with tool calling on the new gateway.
- [Embeddings](https://docs.parasail.io/parasail-docs/api-reference/embeddings.md): Embeddings API for generating vector representations of text using open-source models.
- [Batch API](https://docs.parasail.io/parasail-docs/api-reference/batch-api.md): OpenAI-compatible Batch API reference for Parasail batch processing.
- [Billing API](https://docs.parasail.io/parasail-docs/api-reference/billing-api.md): Programmatically retrieve invoices, real-time month-to-date spend, and hourly or daily usage breakdowns with the Parasail Billing API.
- [Models Endpoint](https://docs.parasail.io/parasail-docs/api-reference/models-endpoint.md): List available models on the Parasail platform using the /v1/models endpoint.
- [Parameters](https://docs.parasail.io/parasail-docs/api-reference/parameters.md): Sampling parameters for the Parasail chat completions and text completions APIs.
- [Chat Completions](https://docs.parasail.io/parasail-docs/guides/chat-completions.md): Send chat messages to instruct-tuned models with Parasail's OpenAI-compatible Chat Completions API.
- [RAG](https://docs.parasail.io/parasail-docs/guides/rag.md): Build Retrieval-Augmented Generation systems that combine embeddings, vector retrieval, and LLM generation on Parasail.
- [Multi-Modal](https://docs.parasail.io/parasail-docs/guides/multi-modal.md): Send images to vision-language models like Qwen2.5-VL using base64 data URLs through Parasail's OpenAI-compatible API.
- [Structured Output](https://docs.parasail.io/parasail-docs/guides/structured-output.md): Get reliable, schema-conformant JSON from Parasail models using guided\_json and response\_format.
- [Tool/Function Calling](https://docs.parasail.io/parasail-docs/guides/tool-function-calling.md): Let Parasail models call your functions and tools via the Chat Completions and Responses APIs.
- [Model Selection](https://docs.parasail.io/parasail-docs/guides/model-recommendations.md): Choose Parasail models by capability, deployment tier, latency, cost, and validation workflow instead of relying on stale static rankings.
- [Pricing](https://docs.parasail.io/parasail-docs/billing/pricing.md): Understand Parasail pricing across the Serverless per-token, Dedicated per-GPU-hour, and Batch discounted per-token tiers.
- [Overview](https://docs.parasail.io/parasail-docs/operate-in-production/overview.md): Run Parasail in production with rate-limit handling, quota planning, dedicated scaling, batch operations, and safe retries.
- [Retries and Idempotency](https://docs.parasail.io/parasail-docs/operate-in-production/retries-and-idempotency.md): Handle 429 responses and transient errors with exponential backoff, sensible timeouts, and safe retries against the Parasail API.
- [Limits and Quotas](https://docs.parasail.io/parasail-docs/operate-in-production/limits-and-quotas.md): Rate limits, GPU quotas, and quota increase guidance for Parasail production workloads.
- [Security Overview](https://docs.parasail.io/parasail-docs/security-and-account-management/overview.md): A security and account-management entry point for Parasail data handling, privacy, compliance, and API-key controls.
- [Account and API Keys](https://docs.parasail.io/parasail-docs/security-and-account-management/account-api-keys.md): Manage Parasail organizations, account access, and read-only API keys.
- [Chat and Text Generation](https://docs.parasail.io/parasail-docs/use-cases/chat-text-generation.md): Build chatbots, assistants, and text generation pipelines with Parasail's OpenAI-compatible API.
- [RAG and Embeddings](https://docs.parasail.io/parasail-docs/use-cases/rag-embeddings.md): Build retrieval-augmented generation (RAG) pipelines and vector search systems with Parasail embeddings.
- [Batch Processing at Scale](https://docs.parasail.io/parasail-docs/use-cases/batch-processing.md): Process large volumes of LLM inferences, embeddings, and multimodal inputs at scale with Parasail Batch.
- [Agents and Tool Calling](https://docs.parasail.io/parasail-docs/use-cases/agents-tool-calling.md): Build agentic workflows with function calling, multi-step reasoning, and tool use on Parasail.
