> ## Documentation Index
> Fetch the complete documentation index at: https://sambanova-systems.mintlify.site/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# Supported models and bundles

SambaStack supports a variety of models that can be deployed to both on-prem and hosted environments. Contact your system administrator to determine which models are available on your deployment.

## Deployment options

When deploying models in SambaStack, administrators can select from various context length and batch size combinations.

* Smaller batch sizes provide higher token throughput (tokens/second).
* Larger batch sizes provide better concurrency for multiple users.

SambaStack supports two deployment configurations – high-interactivity and high-throughput. See [High-throughput deployment](/docs/en/v1.0.57/sambastack/service-administration/deployment-configurations) for when to use each.

## Supported models

You can run the following command to discover available models in your cluster:

```shellscript theme={}
kubectl -n <namespace> get models
```

The table below lists supported models, context lengths, batch sizes, and features.

| Developer/Model ID                      | Modalities      | Suggested Use                                                                       | Context length (batch size)                                                                                                                                                                            | Features and optimizations                                                                                                                                                                                                                                                                                                  | View on Hugging Face                                                                   |
| :-------------------------------------- | :-------------- | ----------------------------------------------------------------------------------- | :----------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------- | :-------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------- | :------------------------------------------------------------------------------------- |
| **Meta**                                |                 |                                                                                     |                                                                                                                                                                                                        |                                                                                                                                                                                                                                                                                                                             |                                                                                        |
| `Meta-Llama-3.3-70B-Instruct`           | Text            | <ul><li>Task agent</li><li>Tool-calling agent</li><li>Text to SQL/Cipher</li></ul>  | <details><summary>View</summary><ul><li>4K (1, 2, 4, 8, 16, 32)</li><li>8K (1, 2, 4, 8, 16, 32)</li><li>16K (1, 2, 4)</li><li>32K (1, 2, 4)</li><li>64K (1, 2, 4)</li><li>128K (1)</li></ul></details> | <details><summary>View</summary><ul><li>Endpoint: Chat completions</li><li>Capabilities: Function calling, JSON mode</li><li>Custom checkpoints supported: Yes</li><li>Optimizations: [Speculative decoding](/docs/en/v1.0.57/sambastack/service-administration/deploy-with-speculative-decoding)</li></ul></details>            | [Model card](https://huggingface.co/meta-llama/Llama-3.3-70B-Instruct)                 |
| `Meta-Llama-3.1-8B-Instruct`            | Text            | <ul><li>Gateway agent</li><li>Validation agent</li></ul>                            | <details><summary>View</summary><ul><li>4K (1, 2, 4, 8, 16, 32, 64, 128)</li><li>8K (1, 2, 4, 8, 16, 32, 64)</li><li>16K (1, 2, 4, 8)</li></ul></details>                                              | <details><summary>View</summary><ul><li>Endpoint: Chat completions</li><li>Capabilities: Function calling, JSON mode</li><li>Custom checkpoints supported: Yes</li><li>Optimizations: None</li></ul></details>                                                                                                              | [Model card](https://huggingface.co/meta-llama/Llama-3.1-8B-Instruct)                  |
| `Meta-Llama-3.1-405B-Instruct`          | Text            | <ul><li>Task agent</li><li>Tool-calling agent</li><li>Code generation</li></ul>     | <details><summary>View</summary><ul><li>4K (1, 2, 4)</li><li>8K (1)</li><li>16K (1)</li></ul></details>                                                                                                | <details><summary>View</summary><ul><li>Endpoint: Chat completions</li><li>Capabilities: Function calling, JSON mode</li><li>Custom checkpoints supported: No</li><li>Optimizations: [Speculative decoding](/docs/en/v1.0.57/sambastack/service-administration/deploy-with-speculative-decoding)</li></ul></details>             | [Model card](https://huggingface.co/meta-llama/Llama-3.1-405B-Instruct)                |
| `Llama-4-Maverick-17B-128E-Instruct`    | Image, Text     | <ul><li>Image understanding</li><li>Task agent</li><li>Tool-calling agent</li></ul> | <details><summary>View</summary><ul><li>8K (1)</li><li>16K (1)</li><li>32K (1)</li><li>64K (1)</li><li>128K (1)</li></ul></details>                                                                    | <details><summary>View</summary><ul><li>Endpoint: Chat completions</li><li>Capabilities: Function calling, JSON mode</li><li>Custom checkpoints supported: No</li><li>Optimizations: None</li></ul></details>                                                                                                               | [Model card](https://huggingface.co/meta-llama/Llama-4-Maverick-17B-128E-Instruct)     |
| **MiniMax**                             |                 |                                                                                     |                                                                                                                                                                                                        |                                                                                                                                                                                                                                                                                                                             |                                                                                        |
| `MiniMax-M2.5`                          | Text            | <ul><li>Coding agent</li></ul>                                                      | <details><summary>View</summary><ul><li>4K-32K (2, 4, 6, 8)</li><li>160K (2)</li></ul></details>                                                                                                       | <details><summary>View</summary><ul><li>Endpoint: Chat completions</li><li>Capabilities: Function calling, Structured output</li><li>Custom checkpoints supported: No</li><li>Optimizations: None</li></ul></details>                                                                                                       | [Model card](https://huggingface.co/MiniMaxAI/MiniMax-M2.5)                            |
| **DeepSeek**                            |                 |                                                                                     |                                                                                                                                                                                                        |                                                                                                                                                                                                                                                                                                                             |                                                                                        |
| `DeepSeek-R1-0528`                      | Reasoning, Text | <ul><li>Complex reasoning</li></ul>                                                 | <details><summary>View</summary><ul><li>4K (4)</li><li>8K (1)</li><li>16K (1)</li><li>32K (1)</li></ul></details>                                                                                      | <details><summary>View</summary><ul><li>Endpoint: Chat completions</li><li>Capabilities: Function calling, JSON mode</li><li>Custom checkpoints supported: No</li><li>Optimizations: None</li></ul></details>                                                                                                               | [Model card](https://huggingface.co/deepseek-ai/DeepSeek-R1)                           |
| `DeepSeek-R1-Distill-Llama-70B` ‡       | Reasoning, Text | <ul><li>Complex reasoning</li></ul>                                                 | <details><summary>View</summary><ul><li>4K (1, 2, 4, 8, 16, 32)</li><li>8K (1, 2, 4, 8)</li><li>16K (1, 2, 4)</li><li>32K (1, 2, 4)</li><li>64K (1)</li><li>128K (1)</li></ul></details>               | <details><summary>View</summary><ul><li>Endpoint: Chat completions</li><li>Capabilities: None</li><li>Custom checkpoints supported: Yes</li><li>Optimizations: [Speculative decoding](/docs/en/v1.0.57/sambastack/service-administration/deploy-with-speculative-decoding)</li></ul></details>                                   | [Model card](https://huggingface.co/deepseek-ai/DeepSeek-R1-Distill-Llama-70B)         |
| `DeepSeek-V3-0324`                      | Text            | <ul><li>Main/planner agent</li><li>Tool-calling agent</li></ul>                     | <details><summary>View</summary><ul><li>4K (4)</li><li>8K (1, 4)</li><li>16K (1)</li><li>32K (1)</li></ul></details>                                                                                   | <details><summary>View</summary><ul><li>Endpoint: Chat completions</li><li>Capabilities: Function calling, JSON mode</li><li>Custom checkpoints supported: No</li><li>Optimizations: [High-throughput](/docs/en/v1.0.57/sambastack/service-administration/deployment-configurations)</li></ul></details>                         | [Model card](https://huggingface.co/deepseek-ai/DeepSeek-V3-0324)                      |
| `DeepSeek-V3.1`                         | Reasoning, Text | <ul><li>Main/planner agent</li><li>Tool-calling agent</li></ul>                     | <details><summary>View</summary><ul><li>4K (4)</li><li>8K (1, 4)</li><li>16K (1)</li><li>32K (1)</li></ul></details>                                                                                   | <details><summary>View</summary><ul><li>Endpoint: Chat completions</li><li>Capabilities: Function calling, JSON mode</li><li>Custom checkpoints supported: No</li><li>Optimizations: [High-throughput](/docs/en/v1.0.57/sambastack/service-administration/deployment-configurations)</li></ul></details>                         | [Model card](https://huggingface.co/deepseek-ai/DeepSeek-V3.1)                         |
| `DeepSeek-V3.2`                         | Text            | <ul><li>Main/planner agent</li><li>Tool-calling agent</li></ul>                     | <details><summary>View</summary><ul><li>8K (1, 4)</li><li>16K (1)</li><li>32K (1)</li><li>128K (1)</li></ul></details>                                                                                 | <details><summary>View</summary><ul><li>Endpoint: Chat completions</li><li>Capabilities: Optional thinking mode, Function calling, JSON mode</li><li>Custom checkpoints supported: No</li><li>Optimizations: [High-throughput](/docs/en/v1.0.57/sambastack/service-administration/deployment-configurations)</li></ul></details> | [Model card](https://huggingface.co/deepseek-ai/DeepSeek-V3.2)                         |
| **OpenAI**                              |                 |                                                                                     |                                                                                                                                                                                                        |                                                                                                                                                                                                                                                                                                                             |                                                                                        |
| `gpt-oss-120b`                          | Text            | <ul><li>Main/planner agent</li><li>Tool-calling agent</li></ul>                     | <details><summary>View</summary><ul><li>8K-32K (2, 4, 6, 8)</li><li>64K (2, 4)</li><li>128K (2)</li></ul></details>                                                                                    | <details><summary>View</summary><ul><li>Endpoint: Chat completions</li><li>Capabilities: Reasoning, Function calling, JSON mode</li><li>Custom checkpoints supported: No</li><li>Optimizations: None</li></ul></details>                                                                                                    | [Model card](https://huggingface.co/openai/gpt-oss-120b)                               |
| `Whisper-Large-v3`                      | Audio           | <ul><li>Automatic speech recognition (ASR)</li><li>Audio transcription</li></ul>    | <details><summary>View</summary><ul><li>4K (1,16,32)</li></ul></details>                                                                                                                               | <details><summary>View</summary><ul><li>Endpoint: Translation, Transcription</li><li>Capabilities: None</li><li>Custom checkpoints supported: No</li><li>Optimizations: None</li></ul></details>                                                                                                                            | [Model card](https://huggingface.co/openai/whisper-large-v3)                           |
| **Google**                              |                 |                                                                                     |                                                                                                                                                                                                        |                                                                                                                                                                                                                                                                                                                             |                                                                                        |
| `gemma-3-27b-it`                        | Image, Text     | <ul><li>Image understanding</li><li>Task agent</li></ul>                            | <details><summary>View</summary><ul><li>4K-128K (2, 4, 6, 8)</li></ul></details>                                                                                                                       | <details><summary>View</summary><ul><li>Endpoint: Chat completions</li><li>Capabilities: Image understanding, JSON mode</li><li>Custom checkpoints supported: No</li><li>Optimizations: None</li></ul></details>                                                                                                            | [Model card](https://huggingface.co/google/gemma-3-27b-it)                             |
| `gemma-3-12b-it`                        | Image, Text     | <ul><li>Image understanding</li><li>Task agent</li></ul>                            | <details><summary>View</summary><ul><li>128K (2, 4, 6, 8)</li></ul></details>                                                                                                                          | <details><summary>View</summary><ul><li>Endpoint: Chat completions</li><li>Capabilities: Image understanding, JSON mode</li><li>Custom checkpoints supported: No</li><li>Optimizations: None</li></ul></details>                                                                                                            | [Model card](https://huggingface.co/google/gemma-3-12b-it)                             |
| **Alibaba Cloud**                       |                 |                                                                                     |                                                                                                                                                                                                        |                                                                                                                                                                                                                                                                                                                             |                                                                                        |
| `Qwen3-235B-A22B-Instruct-2507`         | Text            | <ul><li>Agentic planner</li><li>Multilingual instruction following</li></ul>        | <details><summary>View</summary><ul><li>32K (2, 4, 6, 8)</li><li>128K (2)</li></ul></details>                                                                                                          | <details><summary>View</summary><ul><li>Endpoint: Chat completions</li><li>Capabilities: None</li><li>Custom checkpoints supported: No</li><li>Optimizations: None</li></ul></details>                                                                                                                                      | [Model card](https://huggingface.co/Qwen/Qwen3-235B-A22B-Instruct-2507)                |
| `Qwen3-235B`                            | Text            | <ul><li>Agentic planner</li><li>Multilingual instruction following</li></ul>        | <details><summary>View</summary><ul><li>8K (2, 8)</li><li>16K (2)</li><li>32K (2)</li><li>64K (2)</li><li>128K (2)</li></ul></details>                                                                 | <details><summary>View</summary><ul><li>Endpoint: Chat completions</li><li>Capabilities: None</li><li>Custom checkpoints supported: No</li><li>Optimizations: None</li></ul></details>                                                                                                                                      | [Model card](https://huggingface.co/Qwen/Qwen3-235B-A22B-Instruct-2507)                |
| `Qwen3-32B`                             | Text            | <ul><li>Task agent</li><li>Multilingual instruction following</li></ul>             | <details><summary>View</summary><ul><li>8K (1, 4)</li><li>16K (1)</li><li>32K (1, 2)</li></ul></details>                                                                                               | <details><summary>View</summary><ul><li>Endpoint: Chat completions</li><li>Capabilities: None</li><li>Custom checkpoints supported: No</li><li>Optimizations: None</li></ul></details>                                                                                                                                      | [Model card](https://huggingface.co/Qwen/Qwen3-32B)                                    |
| **Tokyotech-llm**                       |                 |                                                                                     |                                                                                                                                                                                                        |                                                                                                                                                                                                                                                                                                                             |                                                                                        |
| `Llama-3.3-Swallow-70B-Instruct-v0.4` ‡ | Text            | <ul><li>Japanese instruction following</li><li>Task agent</li></ul>                 | <details><summary>View</summary><ul><li>4K (1, 2, 4, 8, 16)</li><li>8K (1, 2, 4, 8, 16)</li><li>16K (1, 2, 4)</li><li>32K (1, 2, 4)</li><li>64K (1)</li><li>128K (1)</li></ul></details>               | <details><summary>View</summary><ul><li>Endpoint: Chat completions</li><li>Capabilities: None</li><li>Custom checkpoints supported: No</li><li>Optimizations: [Speculative decoding](/docs/en/v1.0.57/sambastack/service-administration/deploy-with-speculative-decoding)</li></ul></details>                                    | [Model card](https://huggingface.co/tokyotech-llm/Llama-3.3-Swallow-70B-Instruct-v0.4) |
| **Other**                               |                 |                                                                                     |                                                                                                                                                                                                        |                                                                                                                                                                                                                                                                                                                             |                                                                                        |
| `E5-Mistral-7B-Instruct`                | Embedding       | <ul><li>Vector storage and retrieval (RAG)</li></ul>                                | <details><summary>View</summary><ul><li>4K (1, 4, 8, 16, 32)</li></ul></details>                                                                                                                       | <details><summary>View</summary><ul><li>Endpoint: Embeddings</li><li>Capabilities: None</li><li>Custom checkpoints supported: No</li><li>Optimizations: None</li></ul></details>                                                                                                                                            | [Model card](https://huggingface.co/intfloat/e5-mistral-7b-instruct)                   |

‡ No prebuilt bundle is available for this model in SambaStack. You can use this model to create a [custom bundle](/docs/en/v1.0.57/sambastack/service-administration/custom-bundle-deployment).

## Recommended model bundles

In SambaStack, models are not deployed individually; they are deployed as bundles. A bundle is a packaged deployment that groups one or more models together with their associated configurations, such as batch size and sequence length.

For example, deploying the `Meta‑Llama‑3.3‑70B` model with a batch size of 4 and a sequence length of 16K tokens constitutes a single configuration. A bundle, however, can contain multiple such configurations, either for the same model or for different models.

SambaNova’s RDU technology enables several models and configurations to be loaded simultaneously in a single deployment. This allows you to switch instantly between models and between batch‑/sequence‑size profiles as needed. In contrast to traditional GPU systems, where deployments are typically single‑model and static, SambaStack supports multi‑model, multi‑configuration bundles. This approach delivers higher efficiency, greater flexibility, and increased throughput while preserving low latency.

You can run the following command to discover available bundles in your cluster:

```shellscript theme={}
kubectl -n <namespace> get bundles
```

The table below lists the recommended bundle templates for the models currently available in SambaStack. Each entry pairs a model with its recommended deployment bundle.

<Note>
  If the bundles listed below do not satisfy your inference requirements, you can create [custom bundles](/docs/en/v1.0.57/sambastack/service-administration/custom-bundle-deployment) that combine any mix of models and configurations so long as they fit in DDR memory.
</Note>

| Model name                                                    | Bundle template                                                                                   | Bundle description                                                                                                                                                                                                                                                                                                                                                                                                                                                              | Bundle configuration                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                           |
| ------------------------------------------------------------- | :------------------------------------------------------------------------------------------------ | :------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------ | :------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------- |
| `DeepSeek-R1-0528` / <br />`DeepSeek-V3.1`                    | deepseek-r1-v31-fp8-16k                                                                           | <ul><li>Combination of: <ul><li>`DeepSeek-R1-0528` </li><li>`DeepSeek-V3.1` </li></ul></li><li>Medium context length with low batch size</li></ul>                                                                                                                                                                                                                                                                                                                              | <details><summary>View</summary><p><strong>Models:</strong></p><ul><li>`DeepSeek-R1-0528`<ul><li>Seq Length: 16K, BS: 1</li></ul></li><li>`DeepSeek-V3.1`<ul><li>Seq Length: 16K, BS: 1</li></ul></li></ul></details>                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                          |
| `DeepSeek-V3-0324`                                            | deepseek-r1-v3-fp8-16k                                                                            | <ul><li>Combination of: <ul><li>`DeepSeek-R1-0528` </li><li>`DeepSeek-V3-0324` </li></ul></li><li>Medium context length with low batch size</li></ul>                                                                                                                                                                                                                                                                                                                           | <details><summary>View</summary><p><strong>Models:</strong></p><ul><li>`DeepSeek-R1-0528`<ul><li>Seq Length: 16K, BS: 1</li></ul></li><li>`DeepSeek-V3-0324`<ul><li>Seq Length: 16K, BS: 1</li></ul></li></ul></details>                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                       |
| `E5-Mistral-7B-Instruct` / <br />`Meta-Llama-3.1-8B-Instruct` | us-agentic-rag-1-1                                                                                | <ul><li>Combination of: <ul><li>`gpt-oss-120b`</li><li>`Llama-4-Maverick-17B-128E-Instruct`</li><li>`Meta-Llama-3.1-8B-Instruct`</li><li>`Meta-Llama-3.3-70B` (Target)</li><li>`Meta-Llama-3.2-1B` (Draft)</li><li>`E5-Mistral-7B-Instruct`</li></ul></li><li>Small to medium context length with varied batch size</li><li>[Speculative decoding](/docs/en/v1.0.57/sambastack/service-administration/deploy-with-speculative-decoding) supported for `Meta-Llama-3.3-70B`</li></ul> | <details><summary>View</summary><ul><li>`gpt-oss-120b`<ul><li>Seq Length: 32K, BS: 4</li><li>Seq Length: 64K, BS: 2</li><li>Seq Length: 128K, BS: 2</li></ul></li><li>`Llama-4-Maverick-17B-128E-Instruct`<ul><li>Seq Length: 8K, BS: 1</li><li>Seq Length: 16K, BS: 1</li></ul></li><li>`Meta-Llama-3.3-70B` (Target)/ `Meta-Llama-3.2-1B` (Draft)<ul><li>Seq Length: 4K, BS: 1, 4, 8, 16, 32</li><li>Seq Length: 8K, BS: 1, 4, 8</li><li>Seq Length: 16K, BS: 1, 4</li><li>Seq Length: 32K, BS: 1, 4</li><li>Seq Length: 64K, BS: 1</li><li>Seq Length: 128K, BS: 1</li></ul></li><li>`Meta-Llama-3.1-8B-Instruct`<ul><li>Seq Length: 4K, BS: 1, 4, 16, 32</li><li>Seq Length: 8K, BS: 1, 4, 16, 32</li><li>Seq Length: 16K, BS: 1, 4, 8</li></ul></li><li>`E5-Mistral-7B-Instruct`<ul><li>Seq Length: 4K, BS: 1, 4, 8, 16, 32</li></ul></li></ul></details> |
| `gemma-3-27b-it`                                              | gemma3-27b-32-128k                                                                                | Homogeneous bundle containing `gemma-3-27b-it` configurations.                                                                                                                                                                                                                                                                                                                                                                                                                  | <details><summary>View</summary><ul><li>`gemma-3-27b-it`<ul><li>Seq Length: 32K, BS: 2, 4, 6, 8</li><li>Seq Length: 128K, BS: 2, 4, 6, 8</li></ul></li></ul></details>                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                         |
| `gemma-3-12b-it`                                              | gemma3-v3                                                                                         | <ul><li>Homogeneous bundle containing `gemma-3-12b-it` configurations.</li><li>Large context length with medium batch size</li></ul>                                                                                                                                                                                                                                                                                                                                            | <details><summary>View</summary><ul><li>`gemma-3-12b-it`<ul><li>Seq Length: 128K, BS: 2, 4, 6, 8</li></ul></li></ul></details>                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                 |
| `gpt-oss-120b`                                                | <ul><li>`cd-dyt-gpt-oss-120b-32-64-128k` †</li><li>`cd-dyt-gpt-oss-120b-8-32-64-128k` †</li></ul> | <ul><li>Homogeneous bundles with constrained decoding for `gpt-oss-120b`.</li><li>`cd-dyt-gpt-oss-120b-8-32-64-128k` adds 8K context support.</li></ul>                                                                                                                                                                                                                                                                                                                         | <details><summary>View</summary><ul><li>`cd-dyt-gpt-oss-120b-32-64-128k`<ul><li>Seq Length: 32K, BS: 2, 4, 6, 8</li><li>Seq Length: 64K, BS: 2, 4</li><li>Seq Length: 128K, BS: 2</li></ul></li><li>`cd-dyt-gpt-oss-120b-8-32-64-128k`<ul><li>Seq Length: 8K, BS: 2, 4, 6, 8</li><li>Seq Length: 32K, BS: 2, 4, 6, 8</li><li>Seq Length: 64K, BS: 2, 4</li><li>Seq Length: 128K, BS: 2</li></ul></li></ul></details>                                                                                                                                                                                                                                                                                                                                                                                                                                           |
| `Llama-4-Maverick-17B-128E-Instruct`                          | llama-4-medium-8-16-32-64-128k                                                                    | <ul><li>Homogeneous bundles containing `Llama-4-Maverick-17B-128E-Instruct` configurations.</li><li>Small to large context length with low batch</li></ul>                                                                                                                                                                                                                                                                                                                      | <details><summary>View</summary><ul><li>`Llama-4-Maverick-17B-128E-Instruct`<ul><li>Seq Length: 8K, BS: 1</li><li>Seq Length: 16K, BS: 1</li><li>Seq Length: 32K, BS: 1</li><li>Seq Length: 64K, BS: 1</li><li>Seq Length: 128K, BS: 1</li></ul></li></ul></details>                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                           |
| `Meta-Llama-3.3-70B-Instruct`                                 | 70b-3dot3-ss-4-8-16-32-64-128k                                                                    | <ul><li>[Speculative decoding](/docs/en/v1.0.57/sambastack/service-administration/deploy-with-speculative-decoding) of: <ul><li>`Meta-Llama-3.3-70B` (Target)</li><li>`Meta-Llama-3.2-1B` (Draft)</li></ul></li><li>Medium to large context length with low batch size</li></ul>                                                                                                                                                                                                     | <details><summary>View</summary><p><strong>Target Models:</strong></p><ul><li>`Meta-Llama-3.3-70B-Instruct`<ul><li>Seq Length: 4K, BS: 2, 4, 8, 16, 32</li><li>Seq Length: 8K, BS: 2, 4, 8, 16, 32</li><li>Seq Length: 16K, BS: 1, 2, 4</li><li>Seq Length: 32K, BS: 1, 2, 4</li><li>Seq Length: 64K, BS: 1, 2, 4</li><li>Seq Length: 128K, BS: 1</li></ul></li></ul><p><strong>Draft Models:</strong></p><ul><li>`Meta-Llama-3.2-1B-Instruct`<ul><li>Seq Length: 4K, BS: 2, 4, 8, 16, 32</li><li>Seq Length: 8K, BS: 2, 4, 8, 16, 32</li><li>Seq Length: 16K, BS: 1, 2, 4</li><li>Seq Length: 32K, BS: 1, 2, 4</li><li>Seq Length: 64K, BS: 1, 2, 4; private: true</li><li>Seq Length: 128K, BS: 1; private: true</li></ul></li></ul></details>                                                                                                               |
| `MiniMax-M2.5`                                                | <ul><li>dyt-minimax-m2p5-32k</li><li>dyt-minimax-m2p5-32-160k</li></ul>                           | <ul><li>Homogeneous bundles containing `MiniMax-M2.5` configurations.</li><li>dyt-minimax-m2p5-32k is better for medium sequence lengths and high batching.</li><li>dyt-minimax-m2p5-32-160k is better for higher sequence lengths and low batching</li></ul>                                                                                                                                                                                                                   | <details><summary>View</summary><ul><li>dyt-minimax-m2p5-32k<ul><li>Seq Length: 4K-32K, BS: 2, 4, 6, 8</li></ul></li></ul><ul><li>dyt-minimax-m2p5-32-160k<ul><li>Seq Length: 32K, BS: 2</li><li>Seq Length: 160K, BS: 2</li></ul></li></ul></details>                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                         |
| `Qwen3-235B-A22B-Instruct-2507`                               | dyt-qwen3-235b-32-128k                                                                            | Homogeneous bundle containing `Qwen3-235B-A22B-Instruct-2507` configurations.                                                                                                                                                                                                                                                                                                                                                                                                   | <details><summary>View</summary><ul><li>`Qwen3-235B-A22B-Instruct-2507`<ul><li>Seq Length: 32K, BS: 2, 4, 6, 8</li><li>Seq Length: 128K, BS: 2</li></ul></li></ul></details>                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                   |
| `Qwen3-235B`                                                  | <ul><li>qwen3-235b-8k</li><li>qwen3-235b-16-32-64k</li><li>qwen3-235b-128k</li></ul>              | <ul><li>Homogeneous bundles containing `Qwen3-235B` configurations.</li><li>qwen3-235b-8k: small context with higher batch size.</li><li>qwen3-235b-16-32-64k: medium context lengths.</li><li>qwen3-235b-128k: large context length.</li></ul>                                                                                                                                                                                                                                 | <details><summary>View</summary><ul><li>qwen3-235b-8k<ul><li>Seq Length: 8K, BS: 2, 8</li></ul></li><li>qwen3-235b-16-32-64k<ul><li>Seq Length: 16K, BS: 2</li><li>Seq Length: 32K, BS: 2</li><li>Seq Length: 64K, BS: 2</li></ul></li><li>qwen3-235b-128k<ul><li>Seq Length: 128K, BS: 2</li></ul></li></ul></details>                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                        |
| `Whisper-Large-v3` / <br />`Qwen3-32B`                        | qwen3-32b-whisper-e5-mistral                                                                      | <ul><li>Combination of: <ul><li>`Qwen3-32B`</li><li>`Whisper-Large-v3`</li><li>`E5-Mistral-7B-Instruct`</li></ul></li><li>Small to medium context length with varied batch size</li></ul>                                                                                                                                                                                                                                                                                       | <details><summary>View</summary><ul><li>`E5-Mistral-7B-Instruct`<ul><li>Seq Length: 4K, BS: 1, 4, 8, 16, 32</li></ul></li><li>`Qwen3-32B`<ul><li>Seq Length: 8K, BS: 1, 4</li><li>Seq Length: 16K, BS: 1</li><li>Seq Length: 32K, BS: 1, 2</li></ul></li><li>`Whisper-Large-v3`<ul><li>BS: 1, 16, 32</li></ul></li></ul></details>                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                                             |

† These bundles support sequence lengths from 8K–128K. If you require shorter context lengths (4K–16K) for `gpt-oss-120b`, contact your SambaNova representative.
