{
  "data": [
    {
      "id": "~anthropic/claude-fable-latest",
      "name": "Anthropic: Claude Fable Latest",
      "description": "This model always redirects to the latest model in the Claude Fable family.",
      "provider": "~anthropic",
      "context_length": 1000000,
      "upstream_input_usd_per_token": 0.00001,
      "upstream_output_usd_per_token": 0.00005,
      "our_input_usd_per_token": 0.000013000000000000001,
      "our_output_usd_per_token": 0.00006500000000000001,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+file->text\",\"input_modalities\":[\"text\",\"image\",\"file\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Router\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1000000,\"max_completion_tokens\":128000,\"is_moderated\":false},\"supported_parameters\":[\"include_reasoning\",\"max_completion_tokens\",\"max_tokens\",\"reasoning\",\"reasoning_effort\",\"response_format\",\"stop\",\"structured_outputs\",\"tools\",\"verbosity\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-06-10T00:00:08.808Z"
    },
    {
      "id": "~deepseek/deepseek-v4-flash-latest",
      "name": "DeepSeek: DeepSeek V4 Flash Latest",
      "description": "This model always redirects to the latest model in the DeepSeek V4 Flash family.",
      "provider": "~deepseek",
      "context_length": 1310720,
      "upstream_input_usd_per_token": 3e-8,
      "upstream_output_usd_per_token": 7e-8,
      "our_input_usd_per_token": 3.9e-8,
      "our_output_usd_per_token": 9.100000000000001e-8,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text->text\",\"input_modalities\":[\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Router\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1048576,\"max_completion_tokens\":393216,\"is_moderated\":false},\"supported_parameters\":[\"frequency_penalty\",\"include_reasoning\",\"logit_bias\",\"logprobs\",\"max_tokens\",\"min_p\",\"parallel_tool_calls\",\"presence_penalty\",\"reasoning\",\"reasoning_effort\",\"repetition_penalty\",\"response_format\",\"seed\",\"stop\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"top_a\",\"top_k\",\"top_logprobs\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-08-02T00:00:04.123Z"
    },
    {
      "id": "~openai/gpt-astra-latest",
      "name": "OpenAI: GPT Astra Latest",
      "description": "This model always redirects to the latest model in the GPT Astra family.",
      "provider": "~openai",
      "context_length": 1050000,
      "upstream_input_usd_per_token": 0.00001,
      "upstream_output_usd_per_token": 0.00005,
      "our_input_usd_per_token": 0.000013000000000000001,
      "our_output_usd_per_token": 0.00006500000000000001,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+file->text\",\"input_modalities\":[\"file\",\"image\",\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Router\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1050000,\"max_completion_tokens\":128000,\"is_moderated\":false},\"supported_parameters\":[\"include_reasoning\",\"max_completion_tokens\",\"max_tokens\",\"reasoning\",\"reasoning_effort\",\"response_format\",\"seed\",\"structured_outputs\",\"tool_choice\",\"tools\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-09-11T18:00:28.244Z"
    },
    {
      "id": "~openai/gpt-luna-latest",
      "name": "OpenAI: GPT Luna Latest",
      "description": "This model always redirects to the latest model in the GPT Luna family.",
      "provider": "~openai",
      "context_length": 1050000,
      "upstream_input_usd_per_token": 2e-7,
      "upstream_output_usd_per_token": 0.0000012,
      "our_input_usd_per_token": 2.6e-7,
      "our_output_usd_per_token": 0.0000015599999999999999,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+file->text\",\"input_modalities\":[\"file\",\"image\",\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Router\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1050000,\"max_completion_tokens\":128000,\"is_moderated\":false},\"supported_parameters\":[\"include_reasoning\",\"max_completion_tokens\",\"max_tokens\",\"reasoning\",\"reasoning_effort\",\"response_format\",\"seed\",\"structured_outputs\",\"tool_choice\",\"tools\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-09-11T18:00:28.244Z"
    },
    {
      "id": "~openai/gpt-sol-latest",
      "name": "OpenAI: GPT Sol Latest",
      "description": "This model always redirects to the latest model in the GPT Sol family.",
      "provider": "~openai",
      "context_length": 1050000,
      "upstream_input_usd_per_token": 0.000002,
      "upstream_output_usd_per_token": 0.00001,
      "our_input_usd_per_token": 0.0000026,
      "our_output_usd_per_token": 0.000013000000000000001,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+file->text\",\"input_modalities\":[\"file\",\"image\",\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Router\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1050000,\"max_completion_tokens\":128000,\"is_moderated\":true},\"supported_parameters\":[\"include_reasoning\",\"max_completion_tokens\",\"max_tokens\",\"reasoning\",\"reasoning_effort\",\"response_format\",\"seed\",\"structured_outputs\",\"tool_choice\",\"tools\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-09-11T18:00:28.244Z"
    },
    {
      "id": "~openai/gpt-terra-latest",
      "name": "OpenAI: GPT Terra Latest",
      "description": "This model always redirects to the latest model in the GPT Terra family.",
      "provider": "~openai",
      "context_length": 1050000,
      "upstream_input_usd_per_token": 0.000002,
      "upstream_output_usd_per_token": 0.000012,
      "our_input_usd_per_token": 0.0000026,
      "our_output_usd_per_token": 0.0000156,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+file->text\",\"input_modalities\":[\"file\",\"image\",\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Router\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1050000,\"max_completion_tokens\":128000,\"is_moderated\":false},\"supported_parameters\":[\"include_reasoning\",\"max_completion_tokens\",\"max_tokens\",\"reasoning\",\"reasoning_effort\",\"response_format\",\"seed\",\"structured_outputs\",\"tool_choice\",\"tools\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-09-11T18:00:28.244Z"
    },
    {
      "id": "~x-ai/grok-latest",
      "name": "xAI: Grok Latest",
      "description": "This model always redirects to the latest Grok model from xAI.",
      "provider": "~x-ai",
      "context_length": 500000,
      "upstream_input_usd_per_token": 0.000002,
      "upstream_output_usd_per_token": 0.000006,
      "our_input_usd_per_token": 0.0000026,
      "our_output_usd_per_token": 0.0000078,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+file->text\",\"input_modalities\":[\"text\",\"image\",\"file\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Router\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":500000,\"max_completion_tokens\":450000,\"is_moderated\":false},\"supported_parameters\":[\"include_reasoning\",\"logprobs\",\"max_tokens\",\"reasoning\",\"reasoning_effort\",\"response_format\",\"seed\",\"stop\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"top_k\",\"top_logprobs\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-07-09T00:00:59.452Z"
    },
    {
      "id": "~z-ai/glm-flash-latest",
      "name": "Z.ai: GLM Flash Latest",
      "description": "This model always redirects to the latest model in the GLM Flash family.",
      "provider": "~z-ai",
      "context_length": 1310720,
      "upstream_input_usd_per_token": 7.5e-8,
      "upstream_output_usd_per_token": 2.5e-7,
      "our_input_usd_per_token": 9.749999999999999e-8,
      "our_output_usd_per_token": 3.25e-7,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+video->text\",\"input_modalities\":[\"text\",\"image\",\"video\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Router\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1048576,\"max_completion_tokens\":131072,\"is_moderated\":false},\"supported_parameters\":[\"frequency_penalty\",\"include_reasoning\",\"logit_bias\",\"logprobs\",\"max_tokens\",\"min_p\",\"presence_penalty\",\"reasoning\",\"reasoning_effort\",\"repetition_penalty\",\"response_format\",\"seed\",\"stop\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"top_k\",\"top_logprobs\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-09-02T06:00:26.850Z"
    },
    {
      "id": "~z-ai/glm-latest",
      "name": "Z.ai: GLM Latest",
      "description": "This model always redirects to the latest GLM model from Z.ai.",
      "provider": "~z-ai",
      "context_length": 1310720,
      "upstream_input_usd_per_token": 8.727e-7,
      "upstream_output_usd_per_token": 0.00000336,
      "our_input_usd_per_token": 0.0000011345100000000002,
      "our_output_usd_per_token": 0.000004368,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text->text\",\"input_modalities\":[\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Router\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1048576,\"max_completion_tokens\":943718,\"is_moderated\":false},\"supported_parameters\":[\"frequency_penalty\",\"include_reasoning\",\"logit_bias\",\"logprobs\",\"max_tokens\",\"min_p\",\"parallel_tool_calls\",\"presence_penalty\",\"reasoning\",\"reasoning_effort\",\"repetition_penalty\",\"response_format\",\"seed\",\"stop\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"top_k\",\"top_logprobs\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-08-19T18:00:54.685Z"
    },
    {
      "id": "aion-labs/aion-3.0",
      "name": "AionLabs: Aion-3.0",
      "description": "Aion-3.0 is a multi-model roleplaying and storytelling system from AionLabs, built on the GLM family of models. It uses a collaborative generation process in which multiple specialized models each contribute...",
      "provider": "aion-labs",
      "context_length": 131072,
      "upstream_input_usd_per_token": 0.000003,
      "upstream_output_usd_per_token": 0.000006,
      "our_input_usd_per_token": 0.0000039,
      "our_output_usd_per_token": 0.0000078,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text->text\",\"input_modalities\":[\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":131072,\"max_completion_tokens\":32768,\"is_moderated\":false},\"supported_parameters\":[\"include_reasoning\",\"max_tokens\",\"reasoning\",\"response_format\",\"temperature\",\"tool_choice\",\"tools\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-07-08T00:00:46.252Z"
    },
    {
      "id": "aion-labs/aion-3.0-mini",
      "name": "AionLabs: Aion-3.0-Mini",
      "description": "Aion-3.0 Mini is a multi-model roleplaying and storytelling system from AionLabs, built on the DeepSeek family of models. It uses a collaborative generation process in which multiple specialized models each...",
      "provider": "aion-labs",
      "context_length": 131072,
      "upstream_input_usd_per_token": 7e-7,
      "upstream_output_usd_per_token": 0.0000014,
      "our_input_usd_per_token": 9.1e-7,
      "our_output_usd_per_token": 0.00000182,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text->text\",\"input_modalities\":[\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":131072,\"max_completion_tokens\":32768,\"is_moderated\":false},\"supported_parameters\":[\"include_reasoning\",\"max_tokens\",\"reasoning\",\"response_format\",\"temperature\",\"tool_choice\",\"tools\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-07-08T00:00:46.252Z"
    },
    {
      "id": "anthropic/claude-fable-5",
      "name": "Anthropic: Claude Fable 5",
      "description": "Claude Fable 5 is a Mythos-class model from Anthropic, built for autonomous knowledge work and coding. It supports text, image, and file inputs with text output, with reasoning support and...",
      "provider": "anthropic",
      "context_length": 1000000,
      "upstream_input_usd_per_token": 0.00001,
      "upstream_output_usd_per_token": 0.00005,
      "our_input_usd_per_token": 0.000013000000000000001,
      "our_output_usd_per_token": 0.00006500000000000001,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+file->text\",\"input_modalities\":[\"text\",\"image\",\"file\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Claude\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1000000,\"max_completion_tokens\":128000,\"is_moderated\":true},\"supported_parameters\":[\"include_reasoning\",\"max_completion_tokens\",\"max_tokens\",\"reasoning\",\"reasoning_effort\",\"response_format\",\"stop\",\"structured_outputs\",\"tool_choice\",\"tools\",\"verbosity\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-06-09T18:00:08.703Z"
    },
    {
      "id": "anthropic/claude-fable-5:batch",
      "name": "Anthropic: Claude Fable 5 (batch)",
      "description": "Claude Fable 5 is a Mythos-class model from Anthropic, built for autonomous knowledge work and coding. It supports text, image, and file inputs with text output, with reasoning support and...",
      "provider": "anthropic",
      "context_length": 1000000,
      "upstream_input_usd_per_token": 0.000005,
      "upstream_output_usd_per_token": 0.000025,
      "our_input_usd_per_token": 0.0000065000000000000004,
      "our_output_usd_per_token": 0.000032500000000000004,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+file->text\",\"input_modalities\":[\"text\",\"image\",\"file\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Claude\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1000000,\"max_completion_tokens\":128000,\"is_moderated\":true},\"supported_parameters\":[\"include_reasoning\",\"max_tokens\",\"reasoning\",\"reasoning_effort\",\"response_format\",\"stop\",\"structured_outputs\",\"tool_choice\",\"tools\",\"verbosity\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-07-28T18:01:04.925Z"
    },
    {
      "id": "anthropic/claude-fable-5.1",
      "name": "Anthropic: Claude Fable 5.1",
      "description": "Claude Fable 5.1 improves on Claude Fable 5 across the board, with the biggest gains in agentic coding, long-running agentic workflows, and knowledge work: long code refactors, front-end and visual...",
      "provider": "anthropic",
      "context_length": 1000000,
      "upstream_input_usd_per_token": 0.00001,
      "upstream_output_usd_per_token": 0.00005,
      "our_input_usd_per_token": 0.000013000000000000001,
      "our_output_usd_per_token": 0.00006500000000000001,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+file->text\",\"input_modalities\":[\"text\",\"image\",\"file\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Claude\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1000000,\"max_completion_tokens\":128000,\"is_moderated\":true},\"supported_parameters\":[\"include_reasoning\",\"max_completion_tokens\",\"max_tokens\",\"reasoning\",\"reasoning_effort\",\"response_format\",\"stop\",\"structured_outputs\",\"tools\",\"verbosity\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-09-02T00:00:21.363Z"
    },
    {
      "id": "anthropic/claude-fable-5.1:batch",
      "name": "Anthropic: Claude Fable 5.1 (batch)",
      "description": "Claude Fable 5.1 improves on Claude Fable 5 across the board, with the biggest gains in agentic coding, long-running agentic workflows, and knowledge work: long code refactors, front-end and visual...",
      "provider": "anthropic",
      "context_length": 1000000,
      "upstream_input_usd_per_token": 0.000005,
      "upstream_output_usd_per_token": 0.000025,
      "our_input_usd_per_token": 0.0000065000000000000004,
      "our_output_usd_per_token": 0.000032500000000000004,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+file->text\",\"input_modalities\":[\"text\",\"image\",\"file\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Claude\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1000000,\"max_completion_tokens\":128000,\"is_moderated\":true},\"supported_parameters\":[\"include_reasoning\",\"max_tokens\",\"reasoning\",\"reasoning_effort\",\"response_format\",\"stop\",\"structured_outputs\",\"tool_choice\",\"tools\",\"verbosity\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-09-02T06:00:26.850Z"
    },
    {
      "id": "anthropic/claude-opus-5",
      "name": "Claude Opus 5",
      "description": "Claude Opus 5 is Anthropic’s flagship model for demanding reasoning, coding, and long-horizon agentic work. It is particularly strong at end-to-end software tasks, code review and bug finding, visual analysis...",
      "provider": "anthropic",
      "context_length": 1000000,
      "upstream_input_usd_per_token": 0.000005,
      "upstream_output_usd_per_token": 0.000025,
      "our_input_usd_per_token": 0.0000065000000000000004,
      "our_output_usd_per_token": 0.000032500000000000004,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+file->text\",\"input_modalities\":[\"text\",\"image\",\"file\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Claude\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1000000,\"max_completion_tokens\":128000,\"is_moderated\":true},\"supported_parameters\":[\"include_reasoning\",\"max_completion_tokens\",\"max_tokens\",\"reasoning\",\"reasoning_effort\",\"response_format\",\"stop\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"verbosity\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-07-24T18:00:31.895Z"
    },
    {
      "id": "anthropic/claude-opus-5:batch",
      "name": "Claude Opus 5 (batch)",
      "description": "Claude Opus 5 is Anthropic’s flagship model for demanding reasoning, coding, and long-horizon agentic work. It is particularly strong at end-to-end software tasks, code review and bug finding, visual analysis...",
      "provider": "anthropic",
      "context_length": 1000000,
      "upstream_input_usd_per_token": 0.0000025,
      "upstream_output_usd_per_token": 0.0000125,
      "our_input_usd_per_token": 0.0000032500000000000002,
      "our_output_usd_per_token": 0.000016250000000000002,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+file->text\",\"input_modalities\":[\"text\",\"image\",\"file\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Claude\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1000000,\"max_completion_tokens\":128000,\"is_moderated\":true},\"supported_parameters\":[\"include_reasoning\",\"max_tokens\",\"reasoning\",\"reasoning_effort\",\"response_format\",\"stop\",\"structured_outputs\",\"tool_choice\",\"tools\",\"verbosity\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-07-28T18:01:04.925Z"
    },
    {
      "id": "anthropic/claude-sonnet-5",
      "name": "Anthropic: Claude Sonnet 5",
      "description": "Sonnet 5 is Anthropic's most capable Sonnet-class model, with frontier performance across coding, agents, and professional work. It supports adaptive thinking with selectable reasoning effort levels (low, medium, high, max,...",
      "provider": "anthropic",
      "context_length": 1000000,
      "upstream_input_usd_per_token": 0.000002,
      "upstream_output_usd_per_token": 0.00001,
      "our_input_usd_per_token": 0.0000026,
      "our_output_usd_per_token": 0.000013000000000000001,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+file->text\",\"input_modalities\":[\"text\",\"image\",\"file\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Claude\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1000000,\"max_completion_tokens\":128000,\"is_moderated\":true},\"supported_parameters\":[\"include_reasoning\",\"max_completion_tokens\",\"max_tokens\",\"reasoning\",\"reasoning_effort\",\"response_format\",\"stop\",\"structured_outputs\",\"tool_choice\",\"tools\",\"verbosity\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-07-01T00:00:23.266Z"
    },
    {
      "id": "anthropic/claude-sonnet-5:batch",
      "name": "Anthropic: Claude Sonnet 5 (batch)",
      "description": "Sonnet 5 is Anthropic's most capable Sonnet-class model, with frontier performance across coding, agents, and professional work. It supports adaptive thinking with selectable reasoning effort levels (low, medium, high, max,...",
      "provider": "anthropic",
      "context_length": 1000000,
      "upstream_input_usd_per_token": 0.000001,
      "upstream_output_usd_per_token": 0.000005,
      "our_input_usd_per_token": 0.0000013,
      "our_output_usd_per_token": 0.0000065000000000000004,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+file->text\",\"input_modalities\":[\"text\",\"image\",\"file\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Claude\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1000000,\"max_completion_tokens\":128000,\"is_moderated\":true},\"supported_parameters\":[\"include_reasoning\",\"max_tokens\",\"reasoning\",\"reasoning_effort\",\"response_format\",\"stop\",\"structured_outputs\",\"tool_choice\",\"tools\",\"verbosity\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-07-28T18:01:04.925Z"
    },
    {
      "id": "bytedance-seed/seed-2-1-turbo",
      "name": "ByteDance Seed: Seed 2.1 Turbo",
      "description": "Seed 2.1 Turbo is a multimodal model from ByteDance Seed for coding and long-horizon agent workflows. It is suited for end-to-end software delivery, multi-step task execution, and understanding visual and...",
      "provider": "bytedance-seed",
      "context_length": 262144,
      "upstream_input_usd_per_token": 5e-7,
      "upstream_output_usd_per_token": 0.0000025,
      "our_input_usd_per_token": 6.5e-7,
      "our_output_usd_per_token": 0.0000032500000000000002,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+video->text\",\"input_modalities\":[\"text\",\"image\",\"video\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":262144,\"max_completion_tokens\":235929,\"is_moderated\":false},\"supported_parameters\":[\"frequency_penalty\",\"include_reasoning\",\"max_tokens\",\"reasoning\",\"response_format\",\"stop\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-08-12T18:00:37.453Z"
    },
    {
      "id": "bytedance-seed/seed-2.0-code",
      "name": "ByteDance Seed: Seed-2.0-Code",
      "description": "Seed 2.0 Code is a model from ByteDance Seed optimized for agentic coding. It is suited for frontend development, multilingual programming tasks, and coding-agent workflows in tools such as Claude...",
      "provider": "bytedance-seed",
      "context_length": 262144,
      "upstream_input_usd_per_token": 5e-7,
      "upstream_output_usd_per_token": 0.000003,
      "our_input_usd_per_token": 6.5e-7,
      "our_output_usd_per_token": 0.0000039,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+video->text\",\"input_modalities\":[\"text\",\"image\",\"video\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":262144,\"max_completion_tokens\":131072,\"is_moderated\":false},\"supported_parameters\":[\"frequency_penalty\",\"include_reasoning\",\"max_tokens\",\"reasoning\",\"reasoning_effort\",\"response_format\",\"stop\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-08-11T18:00:38.248Z"
    },
    {
      "id": "cohere/north-mini-code:free",
      "name": "Cohere: North Mini Code (free)",
      "description": "North Mini Code is Cohere's first agentic coding model and the debut of its North family. A sparse mixture-of-experts model with 30B total parameters and 3B active, it is optimized...",
      "provider": "cohere",
      "context_length": 256000,
      "upstream_input_usd_per_token": 0,
      "upstream_output_usd_per_token": 0,
      "our_input_usd_per_token": 0,
      "our_output_usd_per_token": 0,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text->text\",\"input_modalities\":[\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Cohere\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":256000,\"max_completion_tokens\":64000,\"is_moderated\":true},\"supported_parameters\":[\"frequency_penalty\",\"include_reasoning\",\"max_tokens\",\"presence_penalty\",\"reasoning\",\"seed\",\"stop\",\"temperature\",\"tool_choice\",\"tools\",\"top_k\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-06-18T00:00:57.290Z"
    },
    {
      "id": "deepseek/deepseek-v4-flash-0731",
      "name": "DeepSeek: DeepSeek V4 Flash 0731",
      "description": "DeepSeek V4 Flash 0731 is a sparse mixture-of-experts model from DeepSeek, with 13B active parameters out of 284B total. This re-post-trained revision is suited for coding, reasoning, and agent workflows....",
      "provider": "deepseek",
      "context_length": 1310720,
      "upstream_input_usd_per_token": 4e-8,
      "upstream_output_usd_per_token": 8e-8,
      "our_input_usd_per_token": 5.2e-8,
      "our_output_usd_per_token": 1.04e-7,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text->text\",\"input_modalities\":[\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"DeepSeek\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1048576,\"max_completion_tokens\":943718,\"is_moderated\":false},\"supported_parameters\":[\"frequency_penalty\",\"include_reasoning\",\"logit_bias\",\"logprobs\",\"max_tokens\",\"min_p\",\"parallel_tool_calls\",\"presence_penalty\",\"reasoning\",\"reasoning_effort\",\"repetition_penalty\",\"response_format\",\"seed\",\"stop\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"top_a\",\"top_k\",\"top_logprobs\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-07-31T12:00:47.061Z"
    },
    {
      "id": "deepseek/deepseek-v4-flash-0731:batch",
      "name": "DeepSeek: DeepSeek V4 Flash 0731 (batch)",
      "description": "DeepSeek V4 Flash 0731 is a sparse mixture-of-experts model from DeepSeek, with 13B active parameters out of 284B total. This re-post-trained revision is suited for coding, reasoning, and agent workflows....",
      "provider": "deepseek",
      "context_length": 1048576,
      "upstream_input_usd_per_token": 1.1e-7,
      "upstream_output_usd_per_token": 3.3e-7,
      "our_input_usd_per_token": 1.4300000000000002e-7,
      "our_output_usd_per_token": 4.2900000000000004e-7,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text->text\",\"input_modalities\":[\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"DeepSeek\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1048576,\"max_completion_tokens\":943718,\"is_moderated\":false},\"supported_parameters\":[\"frequency_penalty\",\"include_reasoning\",\"logit_bias\",\"logprobs\",\"max_tokens\",\"min_p\",\"presence_penalty\",\"reasoning\",\"reasoning_effort\",\"repetition_penalty\",\"response_format\",\"stop\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"top_k\",\"top_logprobs\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-08-29T00:00:43.742Z"
    },
    {
      "id": "deepseek/deepseek-v4-flash-vision-exp",
      "name": "DeepSeek: DeepSeek V4 Flash Vision Exp",
      "description": "DeepSeek V4 Flash Vision Exp is an experimental vision-enabled version of [DeepSeek V4 Flash 0731](https://openrouter.ai/deepseek/deepseek-v4-flash-0731) from DeepSeek, adding image understanding while matching the base model on text capabilities including agents,...",
      "provider": "deepseek",
      "context_length": 1048576,
      "upstream_input_usd_per_token": 2.2e-7,
      "upstream_output_usd_per_token": 6.6e-7,
      "our_input_usd_per_token": 2.8600000000000005e-7,
      "our_output_usd_per_token": 8.580000000000001e-7,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image->text\",\"input_modalities\":[\"text\",\"image\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"DeepSeek\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1048576,\"max_completion_tokens\":943718,\"is_moderated\":false},\"supported_parameters\":[\"frequency_penalty\",\"include_reasoning\",\"logit_bias\",\"logprobs\",\"max_tokens\",\"min_p\",\"presence_penalty\",\"reasoning\",\"reasoning_effort\",\"repetition_penalty\",\"response_format\",\"seed\",\"stop\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"top_k\",\"top_logprobs\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-08-21T12:00:08.385Z"
    },
    {
      "id": "deepseek/deepseek-v4-flash-vision-exp:batch",
      "name": "DeepSeek: DeepSeek V4 Flash Vision Exp (batch)",
      "description": "DeepSeek V4 Flash Vision Exp is an experimental vision-enabled version of [DeepSeek V4 Flash 0731](https://openrouter.ai/deepseek/deepseek-v4-flash-0731) from DeepSeek, adding image understanding while matching the base model on text capabilities including agents,...",
      "provider": "deepseek",
      "context_length": 1048576,
      "upstream_input_usd_per_token": 1.1e-7,
      "upstream_output_usd_per_token": 3.3e-7,
      "our_input_usd_per_token": 1.4300000000000002e-7,
      "our_output_usd_per_token": 4.2900000000000004e-7,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image->text\",\"input_modalities\":[\"text\",\"image\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"DeepSeek\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1048576,\"max_completion_tokens\":943718,\"is_moderated\":false},\"supported_parameters\":[\"frequency_penalty\",\"include_reasoning\",\"logit_bias\",\"logprobs\",\"max_tokens\",\"presence_penalty\",\"reasoning\",\"reasoning_effort\",\"repetition_penalty\",\"response_format\",\"stop\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"top_k\",\"top_logprobs\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-09-08T18:00:24.611Z"
    },
    {
      "id": "deepseek/deepseek-v4-pro-0813",
      "name": "DeepSeek: DeepSeek V4 Pro 0813",
      "description": "DeepSeek V4 Pro 0813 is a large-scale mixture-of-experts model from DeepSeek. This is the GA release of DeepSeek V4 Pro.",
      "provider": "deepseek",
      "context_length": 1048576,
      "upstream_input_usd_per_token": 5.7948e-7,
      "upstream_output_usd_per_token": 0.00000173844,
      "our_input_usd_per_token": 7.53324e-7,
      "our_output_usd_per_token": 0.000002259972,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text->text\",\"input_modalities\":[\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"DeepSeek\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1024000,\"max_completion_tokens\":384000,\"is_moderated\":false},\"supported_parameters\":[\"frequency_penalty\",\"include_reasoning\",\"logit_bias\",\"logprobs\",\"max_tokens\",\"min_p\",\"presence_penalty\",\"reasoning\",\"reasoning_effort\",\"repetition_penalty\",\"response_format\",\"seed\",\"stop\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"top_k\",\"top_logprobs\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-08-12T18:00:37.453Z"
    },
    {
      "id": "deepseek/deepseek-v4-pro-0813:batch",
      "name": "DeepSeek: DeepSeek V4 Pro 0813 (batch)",
      "description": "DeepSeek V4 Pro 0813 is a large-scale mixture-of-experts model from DeepSeek. This is the GA release of DeepSeek V4 Pro.",
      "provider": "deepseek",
      "context_length": 1048576,
      "upstream_input_usd_per_token": 6.6e-7,
      "upstream_output_usd_per_token": 0.00000198,
      "our_input_usd_per_token": 8.580000000000001e-7,
      "our_output_usd_per_token": 0.0000025740000000000003,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text->text\",\"input_modalities\":[\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"DeepSeek\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1048576,\"max_completion_tokens\":943718,\"is_moderated\":false},\"supported_parameters\":[\"frequency_penalty\",\"include_reasoning\",\"logit_bias\",\"logprobs\",\"max_tokens\",\"min_p\",\"presence_penalty\",\"reasoning\",\"reasoning_effort\",\"repetition_penalty\",\"response_format\",\"stop\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"top_k\",\"top_logprobs\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-08-29T00:00:43.742Z"
    },
    {
      "id": "deepseek/deepseek-v4.1-flash",
      "name": "DeepSeek: DeepSeek V4.1 Flash",
      "description": "DeepSeek V4.1 Flash is a sparse mixture-of-experts model from DeepSeek, and the first built on the company's Causal Encoder-Decoder (CED) architecture. It activates 8B parameters on input and 16B on...",
      "provider": "deepseek",
      "context_length": 1048576,
      "upstream_input_usd_per_token": 1.5e-7,
      "upstream_output_usd_per_token": 6e-7,
      "our_input_usd_per_token": 1.9499999999999999e-7,
      "our_output_usd_per_token": 7.799999999999999e-7,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image->text\",\"input_modalities\":[\"text\",\"image\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"DeepSeek\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1048576,\"max_completion_tokens\":384000,\"is_moderated\":false},\"supported_parameters\":[\"frequency_penalty\",\"include_reasoning\",\"logit_bias\",\"logprobs\",\"max_tokens\",\"min_p\",\"presence_penalty\",\"reasoning\",\"reasoning_effort\",\"repetition_penalty\",\"response_format\",\"seed\",\"stop\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"top_k\",\"top_logprobs\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-09-10T12:00:13.892Z"
    },
    {
      "id": "dots-studio/dots-3-note-preview:free",
      "name": "Dots Studio: Dots3-Note Preview (free)",
      "description": "Dots3-Note Preview is an open-weight mixture-of-experts model from Dots Studio, with 16B active parameters out of 280B total. It is the lightest model in the Dots 3 family and is...",
      "provider": "dots-studio",
      "context_length": 512000,
      "upstream_input_usd_per_token": 0,
      "upstream_output_usd_per_token": 0,
      "our_input_usd_per_token": 0,
      "our_output_usd_per_token": 0,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image->text\",\"input_modalities\":[\"text\",\"image\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":512000,\"max_completion_tokens\":460800,\"is_moderated\":false},\"supported_parameters\":[\"include_reasoning\",\"max_tokens\",\"reasoning\",\"response_format\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-08-14T06:00:37.251Z"
    },
    {
      "id": "google/gemini-3-pro-image",
      "name": "Google: Nano Banana Pro (Gemini 3 Pro Image)",
      "description": "Nano Banana Pro is Google’s most advanced image-generation and editing model, built on Gemini 3 Pro. It extends the original Nano Banana with significantly improved multimodal reasoning, real-world grounding, and...",
      "provider": "google",
      "context_length": 131072,
      "upstream_input_usd_per_token": 0.000002,
      "upstream_output_usd_per_token": 0.000012,
      "our_input_usd_per_token": 0.0000026,
      "our_output_usd_per_token": 0.0000156,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image->text+image\",\"input_modalities\":[\"image\",\"text\"],\"output_modalities\":[\"image\",\"text\"],\"tokenizer\":\"Gemini\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":65536,\"max_completion_tokens\":32768,\"is_moderated\":false},\"supported_parameters\":[\"include_reasoning\",\"max_tokens\",\"reasoning\",\"response_format\",\"seed\",\"stop\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-06-18T06:00:57.328Z"
    },
    {
      "id": "google/gemini-3.1-flash-image",
      "name": "Google: Nano Banana 2 (Gemini 3.1 Flash Image)",
      "description": "Gemini 3.1 Flash Image, a.k.a. \"Nano Banana 2,\" is Google’s latest state of the art image generation and editing model, delivering Pro-level visual quality at Flash speed. It combines advanced...",
      "provider": "google",
      "context_length": 131072,
      "upstream_input_usd_per_token": 5e-7,
      "upstream_output_usd_per_token": 0.000003,
      "our_input_usd_per_token": 6.5e-7,
      "our_output_usd_per_token": 0.0000039,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image->text+image\",\"input_modalities\":[\"image\",\"text\"],\"output_modalities\":[\"image\",\"text\"],\"tokenizer\":\"Gemini\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":131072,\"max_completion_tokens\":32768,\"is_moderated\":false},\"supported_parameters\":[\"include_reasoning\",\"max_tokens\",\"reasoning\",\"reasoning_effort\",\"response_format\",\"seed\",\"structured_outputs\",\"temperature\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-06-18T06:00:57.328Z"
    },
    {
      "id": "google/gemini-3.1-flash-lite-image",
      "name": "Google: Nano Banana 2 Lite (Gemini 3.1 Flash Lite Image)",
      "description": "Nano Banana 2 Lite (Gemini 3.1 Flash Lite Image) is Google's fastest, most cost-efficient Gemini image model, built for high-velocity developer pipelines and rapid-fire visual exploration. It delivers text-to-image generation...",
      "provider": "google",
      "context_length": 65536,
      "upstream_input_usd_per_token": 2.5e-7,
      "upstream_output_usd_per_token": 0.0000015,
      "our_input_usd_per_token": 3.25e-7,
      "our_output_usd_per_token": 0.00000195,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image->text+image\",\"input_modalities\":[\"image\",\"text\"],\"output_modalities\":[\"image\",\"text\"],\"tokenizer\":\"Gemini\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":65536,\"max_completion_tokens\":58982,\"is_moderated\":false},\"supported_parameters\":[\"include_reasoning\",\"max_tokens\",\"reasoning\",\"reasoning_effort\",\"response_format\",\"seed\",\"temperature\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-06-30T18:00:23.310Z"
    },
    {
      "id": "google/gemini-3.5-flash-lite",
      "name": "Google: Gemini 3.5 Flash Lite",
      "description": "Gemini 3.5 Flash Lite is a high-efficiency model from Google with upgraded agentic capabilities. It is suited for subagents that execute focused tasks within complex, multi-agent workflows.",
      "provider": "google",
      "context_length": 1048576,
      "upstream_input_usd_per_token": 3e-7,
      "upstream_output_usd_per_token": 0.0000025,
      "our_input_usd_per_token": 3.8999999999999997e-7,
      "our_output_usd_per_token": 0.0000032500000000000002,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+file+audio+video->text\",\"input_modalities\":[\"text\",\"image\",\"video\",\"file\",\"audio\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Gemini\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1048576,\"max_completion_tokens\":65536,\"is_moderated\":false},\"supported_parameters\":[\"include_reasoning\",\"max_tokens\",\"reasoning\",\"reasoning_effort\",\"response_format\",\"seed\",\"stop\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-07-21T18:00:32.149Z"
    },
    {
      "id": "google/gemini-3.5-flash-lite:batch",
      "name": "Google: Gemini 3.5 Flash Lite (batch)",
      "description": "Gemini 3.5 Flash Lite is a high-efficiency model from Google with upgraded agentic capabilities. It is suited for subagents that execute focused tasks within complex, multi-agent workflows.",
      "provider": "google",
      "context_length": 1048576,
      "upstream_input_usd_per_token": 1.5e-7,
      "upstream_output_usd_per_token": 0.00000125,
      "our_input_usd_per_token": 1.9499999999999999e-7,
      "our_output_usd_per_token": 0.0000016250000000000001,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+file+audio+video->text\",\"input_modalities\":[\"text\",\"image\",\"video\",\"file\",\"audio\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Gemini\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1048576,\"max_completion_tokens\":65536,\"is_moderated\":false},\"supported_parameters\":[\"include_reasoning\",\"max_tokens\",\"reasoning\",\"reasoning_effort\",\"response_format\",\"seed\",\"stop\",\"structured_outputs\",\"tool_choice\",\"tools\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-07-28T18:01:04.925Z"
    },
    {
      "id": "google/gemini-3.6-flash",
      "name": "Google: Gemini 3.6 Flash",
      "description": "Gemini 3.6 Flash is a high-efficiency model from Google for coding, agentic workflows, and web and app development. It is designed to produce polished outputs with fewer unnecessary edits and...",
      "provider": "google",
      "context_length": 1048576,
      "upstream_input_usd_per_token": 7.5e-7,
      "upstream_output_usd_per_token": 0.00000375,
      "our_input_usd_per_token": 9.75e-7,
      "our_output_usd_per_token": 0.000004875,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+file+audio+video->text\",\"input_modalities\":[\"text\",\"image\",\"video\",\"file\",\"audio\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Gemini\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1048576,\"max_completion_tokens\":65536,\"is_moderated\":false},\"supported_parameters\":[\"include_reasoning\",\"max_tokens\",\"reasoning\",\"reasoning_effort\",\"response_format\",\"seed\",\"stop\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-07-21T18:00:32.149Z"
    },
    {
      "id": "google/gemini-3.6-flash:batch",
      "name": "Google: Gemini 3.6 Flash (batch)",
      "description": "Gemini 3.6 Flash is a high-efficiency model from Google for coding, agentic workflows, and web and app development. It is designed to produce polished outputs with fewer unnecessary edits and...",
      "provider": "google",
      "context_length": 1048576,
      "upstream_input_usd_per_token": 3.75e-7,
      "upstream_output_usd_per_token": 0.000001875,
      "our_input_usd_per_token": 4.875e-7,
      "our_output_usd_per_token": 0.0000024375,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+file+audio+video->text\",\"input_modalities\":[\"text\",\"image\",\"video\",\"file\",\"audio\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Gemini\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1048576,\"max_completion_tokens\":65536,\"is_moderated\":false},\"supported_parameters\":[\"include_reasoning\",\"max_tokens\",\"reasoning\",\"reasoning_effort\",\"response_format\",\"seed\",\"stop\",\"structured_outputs\",\"tool_choice\",\"tools\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-07-28T18:01:04.925Z"
    },
    {
      "id": "google/gemini-3.7-flash",
      "name": "Google: Gemini 3.7 Flash",
      "description": "Gemini 3.7 Flash is a multimodal model from Google for fast agentic workflows, coding, and complex multi-step reasoning. It is designed for tasks that require responsive performance and reliable multi-step...",
      "provider": "google",
      "context_length": 1048576,
      "upstream_input_usd_per_token": 7.5e-7,
      "upstream_output_usd_per_token": 0.00000375,
      "our_input_usd_per_token": 9.75e-7,
      "our_output_usd_per_token": 0.000004875,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+file+audio+video->text\",\"input_modalities\":[\"text\",\"image\",\"video\",\"file\",\"audio\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Gemini\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1048576,\"max_completion_tokens\":65536,\"is_moderated\":false},\"supported_parameters\":[\"include_reasoning\",\"max_tokens\",\"reasoning\",\"reasoning_effort\",\"response_format\",\"seed\",\"stop\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-08-13T18:00:37.139Z"
    },
    {
      "id": "google/gemini-3.7-flash:batch",
      "name": "Google: Gemini 3.7 Flash (batch)",
      "description": "Gemini 3.7 Flash is a multimodal model from Google for fast agentic workflows, coding, and complex multi-step reasoning. It is designed for tasks that require responsive performance and reliable multi-step...",
      "provider": "google",
      "context_length": 1048576,
      "upstream_input_usd_per_token": 3.75e-7,
      "upstream_output_usd_per_token": 0.000001875,
      "our_input_usd_per_token": 4.875e-7,
      "our_output_usd_per_token": 0.0000024375,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+file+audio+video->text\",\"input_modalities\":[\"text\",\"image\",\"video\",\"file\",\"audio\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Gemini\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1048576,\"max_completion_tokens\":65536,\"is_moderated\":false},\"supported_parameters\":[\"include_reasoning\",\"max_tokens\",\"reasoning\",\"reasoning_effort\",\"response_format\",\"seed\",\"stop\",\"structured_outputs\",\"tool_choice\",\"tools\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-08-13T18:00:37.139Z"
    },
    {
      "id": "google/gemini-3.8-flash",
      "name": "Google: Gemini 3.8 Flash",
      "description": "Gemini 3.8 Flash is Google's most intelligent Flash model with significant gains from 3.7 Flash across software engineering, agentic tasks, and multi-step reasoning.",
      "provider": "google",
      "context_length": 1048576,
      "upstream_input_usd_per_token": 7.5e-7,
      "upstream_output_usd_per_token": 0.00000375,
      "our_input_usd_per_token": 9.75e-7,
      "our_output_usd_per_token": 0.000004875,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+file+audio+video->text\",\"input_modalities\":[\"text\",\"image\",\"video\",\"file\",\"audio\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Gemini\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1048576,\"max_completion_tokens\":65536,\"is_moderated\":false},\"supported_parameters\":[\"include_reasoning\",\"max_tokens\",\"reasoning\",\"reasoning_effort\",\"response_format\",\"seed\",\"stop\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-09-02T18:00:33.616Z"
    },
    {
      "id": "google/gemini-3.8-flash:batch",
      "name": "Google: Gemini 3.8 Flash (batch)",
      "description": "Gemini 3.8 Flash is Google's most intelligent Flash model with significant gains from 3.7 Flash across software engineering, agentic tasks, and multi-step reasoning.",
      "provider": "google",
      "context_length": 1048576,
      "upstream_input_usd_per_token": 3.75e-7,
      "upstream_output_usd_per_token": 0.000001875,
      "our_input_usd_per_token": 4.875e-7,
      "our_output_usd_per_token": 0.0000024375,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+file+audio+video->text\",\"input_modalities\":[\"text\",\"image\",\"video\",\"file\",\"audio\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Gemini\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1048576,\"max_completion_tokens\":65536,\"is_moderated\":false},\"supported_parameters\":[\"include_reasoning\",\"max_tokens\",\"reasoning\",\"reasoning_effort\",\"response_format\",\"seed\",\"stop\",\"structured_outputs\",\"tool_choice\",\"tools\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-09-02T18:00:33.616Z"
    },
    {
      "id": "ibm-granite/granite-4.2-8b",
      "name": "IBM: Granite 4.2 8B",
      "description": "Granite 4.2 8B is a dense reasoning model from IBM. It is suited for mathematics, code generation, multilingual dialogue, and agentic workflows that need multi-step reasoning. It supports full, low-effort,...",
      "provider": "ibm-granite",
      "context_length": 131072,
      "upstream_input_usd_per_token": 6e-8,
      "upstream_output_usd_per_token": 2.5e-7,
      "our_input_usd_per_token": 7.8e-8,
      "our_output_usd_per_token": 3.25e-7,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text->text\",\"input_modalities\":[\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":131072,\"max_completion_tokens\":117964,\"is_moderated\":false},\"supported_parameters\":[\"frequency_penalty\",\"include_reasoning\",\"logit_bias\",\"logprobs\",\"max_tokens\",\"min_p\",\"presence_penalty\",\"reasoning\",\"reasoning_effort\",\"repetition_penalty\",\"response_format\",\"seed\",\"stop\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"top_k\",\"top_logprobs\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-09-01T00:00:21.260Z"
    },
    {
      "id": "inception/mercury-2.5",
      "name": "Inception: Mercury 2.5",
      "description": "Mercury 2.5 is the fastest reasoning LLM, and the latest diffusion LLM (dLLM) from Inception. Instead of generating tokens sequentially, Mercury 2.5 produces and refines multiple tokens in parallel, achieving...",
      "provider": "inception",
      "context_length": 260000,
      "upstream_input_usd_per_token": 4e-8,
      "upstream_output_usd_per_token": 1.5e-7,
      "our_input_usd_per_token": 5.2e-8,
      "our_output_usd_per_token": 1.9499999999999999e-7,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text->text\",\"input_modalities\":[\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":260000,\"max_completion_tokens\":65536,\"is_moderated\":false},\"supported_parameters\":[\"include_reasoning\",\"max_tokens\",\"reasoning\",\"reasoning_effort\",\"response_format\",\"stop\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-09-09T00:00:22.381Z"
    },
    {
      "id": "inclusionai/ling-3.0-flash",
      "name": "inclusionAI: Ling 3.0 Flash",
      "description": "*Ling-3.0-flash* is a *124B-parameter Mixture-of-Experts (MoE) model*, with approximately *5.1B parameters activated per token*. The model is designed with *token efficiency and production-scale agentic inference* as key priorities, enabling developers...",
      "provider": "inclusionai",
      "context_length": 262144,
      "upstream_input_usd_per_token": 2.1e-8,
      "upstream_output_usd_per_token": 6.3e-8,
      "our_input_usd_per_token": 2.73e-8,
      "our_output_usd_per_token": 8.19e-8,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text->text\",\"input_modalities\":[\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":262144,\"max_completion_tokens\":32768,\"is_moderated\":false},\"supported_parameters\":[\"frequency_penalty\",\"include_reasoning\",\"logit_bias\",\"logprobs\",\"max_tokens\",\"min_p\",\"presence_penalty\",\"reasoning\",\"repetition_penalty\",\"response_format\",\"seed\",\"stop\",\"temperature\",\"tool_choice\",\"tools\",\"top_k\",\"top_logprobs\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-07-23T18:00:31.835Z"
    },
    {
      "id": "inclusionai/ling-3.0-flash-fin",
      "name": "inclusionAI: Ling 3.0 Flash Fin",
      "description": "Ling 3.0 Flash Fin is a finance-focused mixture-of-experts model from InclusionAI, built on Ling 3.0 Flash with 5.1B active parameters out of 124B total. It is designed for real-world investment...",
      "provider": "inclusionai",
      "context_length": 262144,
      "upstream_input_usd_per_token": 6e-8,
      "upstream_output_usd_per_token": 1.8e-7,
      "our_input_usd_per_token": 7.8e-8,
      "our_output_usd_per_token": 2.34e-7,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text->text\",\"input_modalities\":[\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":262144,\"max_completion_tokens\":235929,\"is_moderated\":false},\"supported_parameters\":[\"frequency_penalty\",\"include_reasoning\",\"logit_bias\",\"max_tokens\",\"min_p\",\"presence_penalty\",\"reasoning\",\"repetition_penalty\",\"response_format\",\"seed\",\"stop\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"top_k\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-09-03T18:00:33.637Z"
    },
    {
      "id": "inclusionai/ling-3.0-flash-fin:free",
      "name": "inclusionAI: Ling 3.0 Flash Fin (free)",
      "description": "Ling 3.0 Flash Fin is a finance-focused mixture-of-experts model from InclusionAI, built on Ling 3.0 Flash with 5.1B active parameters out of 124B total. It is designed for real-world investment...",
      "provider": "inclusionai",
      "context_length": 262144,
      "upstream_input_usd_per_token": 0,
      "upstream_output_usd_per_token": 0,
      "our_input_usd_per_token": 0,
      "our_output_usd_per_token": 0,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text->text\",\"input_modalities\":[\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":262144,\"max_completion_tokens\":32768,\"is_moderated\":false},\"supported_parameters\":[\"frequency_penalty\",\"include_reasoning\",\"logprobs\",\"max_tokens\",\"presence_penalty\",\"reasoning\",\"repetition_penalty\",\"seed\",\"stop\",\"temperature\",\"tool_choice\",\"tools\",\"top_k\",\"top_logprobs\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-08-27T18:00:43.754Z"
    },
    {
      "id": "inclusionai/ling-3.0-flash-sante:free",
      "name": "inclusionAI: Ling 3.0 Flash Sante (free)",
      "description": "Ling 3.0 Flash Sante is a health and medicine-focused mixture-of-experts model from InclusionAI, built on Ling 3.0 Flash with 5.1B active parameters out of 124B total. It is designed for...",
      "provider": "inclusionai",
      "context_length": 262144,
      "upstream_input_usd_per_token": 0,
      "upstream_output_usd_per_token": 0,
      "our_input_usd_per_token": 0,
      "our_output_usd_per_token": 0,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text->text\",\"input_modalities\":[\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":262144,\"max_completion_tokens\":32768,\"is_moderated\":false},\"supported_parameters\":[\"frequency_penalty\",\"include_reasoning\",\"logprobs\",\"max_tokens\",\"presence_penalty\",\"reasoning\",\"repetition_penalty\",\"seed\",\"stop\",\"temperature\",\"tool_choice\",\"tools\",\"top_k\",\"top_logprobs\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-09-05T00:00:33.612Z"
    },
    {
      "id": "inclusionai/ling-3.0-flash-vl",
      "name": "inclusionAI: Ling 3.0 Flash VL",
      "description": "Ling 3.0 Flash VL builds on Ling 3.0 Flash (124B total / 5.5B active MoE from InclusionAI), further strengthening its language capabilities while adding native visual perception and advanced visual...",
      "provider": "inclusionai",
      "context_length": 131072,
      "upstream_input_usd_per_token": 6e-8,
      "upstream_output_usd_per_token": 1.8e-7,
      "our_input_usd_per_token": 7.8e-8,
      "our_output_usd_per_token": 2.34e-7,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+video->text\",\"input_modalities\":[\"text\",\"image\",\"video\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":131072,\"max_completion_tokens\":32768,\"is_moderated\":false},\"supported_parameters\":[\"frequency_penalty\",\"include_reasoning\",\"logit_bias\",\"max_tokens\",\"min_p\",\"presence_penalty\",\"reasoning\",\"repetition_penalty\",\"response_format\",\"seed\",\"stop\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"top_k\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-09-11T18:00:28.244Z"
    },
    {
      "id": "inclusionai/ling-3.0-flash-vl:free",
      "name": "inclusionAI: Ling 3.0 Flash VL (free)",
      "description": "Ling 3.0 Flash VL builds on Ling 3.0 Flash (124B total / 5.5B active MoE from InclusionAI), further strengthening its language capabilities while adding native visual perception and advanced visual...",
      "provider": "inclusionai",
      "context_length": 262144,
      "upstream_input_usd_per_token": 0,
      "upstream_output_usd_per_token": 0,
      "our_input_usd_per_token": 0,
      "our_output_usd_per_token": 0,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+video->text\",\"input_modalities\":[\"text\",\"image\",\"video\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":262144,\"max_completion_tokens\":32768,\"is_moderated\":false},\"supported_parameters\":[\"frequency_penalty\",\"include_reasoning\",\"logprobs\",\"max_tokens\",\"presence_penalty\",\"reasoning\",\"repetition_penalty\",\"seed\",\"stop\",\"temperature\",\"tool_choice\",\"tools\",\"top_k\",\"top_logprobs\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-09-10T18:00:10.340Z"
    },
    {
      "id": "inference-net/schematron-v2-small",
      "name": "Inference.net: Schematron V2 Small",
      "description": "Schematron V2 Small is a 3B-parameter HTML-to-JSON extraction model from Inference.net. It prioritizes extraction quality for complex schemas and long pages. Extraction instructions must be supplied through a JSON schema...",
      "provider": "inference-net",
      "context_length": 128000,
      "upstream_input_usd_per_token": 5e-8,
      "upstream_output_usd_per_token": 2.3e-7,
      "our_input_usd_per_token": 6.5e-8,
      "our_output_usd_per_token": 2.99e-7,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text->text\",\"input_modalities\":[\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":128000,\"max_completion_tokens\":4096,\"is_moderated\":false},\"supported_parameters\":[\"frequency_penalty\",\"logit_bias\",\"max_tokens\",\"min_p\",\"presence_penalty\",\"response_format\",\"seed\",\"stop\",\"structured_outputs\",\"temperature\",\"top_k\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-09-12T06:00:34.703Z"
    },
    {
      "id": "inference-net/schematron-v2-turbo",
      "name": "Inference.net: Schematron V2 Turbo",
      "description": "Schematron V2 Turbo is a 3B-parameter HTML-to-JSON extraction model from Inference.net. It prioritizes throughput for high-volume extraction workloads. Extraction instructions must be supplied through a JSON schema in response_format rather...",
      "provider": "inference-net",
      "context_length": 128000,
      "upstream_input_usd_per_token": 3e-8,
      "upstream_output_usd_per_token": 1.5e-7,
      "our_input_usd_per_token": 3.9e-8,
      "our_output_usd_per_token": 1.9499999999999999e-7,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text->text\",\"input_modalities\":[\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":128000,\"max_completion_tokens\":8192,\"is_moderated\":false},\"supported_parameters\":[\"frequency_penalty\",\"logit_bias\",\"max_tokens\",\"min_p\",\"presence_penalty\",\"response_format\",\"seed\",\"stop\",\"structured_outputs\",\"temperature\",\"top_k\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-09-12T06:00:34.703Z"
    },
    {
      "id": "kwaipilot/kat-coder-pro-v2.5",
      "name": "Kwaipilot: KAT-Coder-Pro V2.5",
      "description": "KAT-Coder-Pro V2.5 is a flagship-level Agentic Coding model that can directly hand over an entire issue or an entire business workflow to it, allowing it to autonomously locate and make...",
      "provider": "kwaipilot",
      "context_length": 262144,
      "upstream_input_usd_per_token": 7.4e-7,
      "upstream_output_usd_per_token": 0.00000296,
      "our_input_usd_per_token": 9.62e-7,
      "our_output_usd_per_token": 0.000003848,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text->text\",\"input_modalities\":[\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":262144,\"max_completion_tokens\":235929,\"is_moderated\":false},\"supported_parameters\":[\"frequency_penalty\",\"logit_bias\",\"max_tokens\",\"min_p\",\"presence_penalty\",\"repetition_penalty\",\"response_format\",\"seed\",\"stop\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"top_k\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-07-14T06:00:15.274Z"
    },
    {
      "id": "liquid/lfm-2.5-2.6b:free",
      "name": "LiquidAI: LFM2.5-2.6B (free)",
      "description": "LFM2.5-2.6B is a compact reasoning model from Liquid AI. It is suited for agent workflows, data extraction, RAG, and long-context processing. Liquid advises against using it for agentic coding or...",
      "provider": "liquid",
      "context_length": 65536,
      "upstream_input_usd_per_token": 0,
      "upstream_output_usd_per_token": 0,
      "our_input_usd_per_token": 0,
      "our_output_usd_per_token": 0,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text->text\",\"input_modalities\":[\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":65536,\"max_completion_tokens\":8192,\"is_moderated\":false},\"supported_parameters\":[\"frequency_penalty\",\"include_reasoning\",\"logprobs\",\"max_completion_tokens\",\"max_tokens\",\"min_p\",\"presence_penalty\",\"reasoning\",\"repetition_penalty\",\"response_format\",\"seed\",\"stop\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"top_k\",\"top_logprobs\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-08-12T00:00:38.315Z"
    },
    {
      "id": "meituan/longcat-2.0",
      "name": "Meituan: LongCat 2.0",
      "description": "LongCat 2.0 is a sparse mixture-of-experts language model from Meituan, with 48B active parameters out of 1.6T total. It is suited for coding, repository-level changes, long-horizon problem solving, and agentic...",
      "provider": "meituan",
      "context_length": 1048756,
      "upstream_input_usd_per_token": 3e-7,
      "upstream_output_usd_per_token": 0.0000012,
      "our_input_usd_per_token": 3.8999999999999997e-7,
      "our_output_usd_per_token": 0.0000015599999999999999,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text->text\",\"input_modalities\":[\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1048756,\"max_completion_tokens\":262144,\"is_moderated\":false},\"supported_parameters\":[\"frequency_penalty\",\"include_reasoning\",\"logit_bias\",\"max_tokens\",\"min_p\",\"presence_penalty\",\"reasoning\",\"repetition_penalty\",\"seed\",\"stop\",\"temperature\",\"tool_choice\",\"tools\",\"top_k\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-07-20T18:00:30.693Z"
    },
    {
      "id": "meta/muse-glimmer-30b",
      "name": "Meta: Muse Glimmer 30B",
      "description": "Muse Glimmer 30B is a dense, open-weight multimodal model from Meta Superintelligence Labs, distilled from Muse Spark and optimized for autonomous agents on consumer hardware. It is suited for long-horizon...",
      "provider": "meta",
      "context_length": 131072,
      "upstream_input_usd_per_token": 3e-7,
      "upstream_output_usd_per_token": 0.0000011,
      "our_input_usd_per_token": 3.8999999999999997e-7,
      "our_output_usd_per_token": 0.00000143,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image->text\",\"input_modalities\":[\"text\",\"image\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":131072,\"max_completion_tokens\":117964,\"is_moderated\":false},\"supported_parameters\":[\"frequency_penalty\",\"include_reasoning\",\"logit_bias\",\"logprobs\",\"max_tokens\",\"min_p\",\"presence_penalty\",\"reasoning\",\"reasoning_effort\",\"repetition_penalty\",\"response_format\",\"seed\",\"stop\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"top_k\",\"top_logprobs\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-08-11T00:00:38.148Z"
    },
    {
      "id": "meta/muse-glimmer-30b:batch",
      "name": "Meta: Muse Glimmer 30B (batch)",
      "description": "Muse Glimmer 30B is a dense, open-weight multimodal model from Meta Superintelligence Labs, distilled from Muse Spark and optimized for autonomous agents on consumer hardware. It is suited for long-horizon...",
      "provider": "meta",
      "context_length": 131072,
      "upstream_input_usd_per_token": 1.75e-7,
      "upstream_output_usd_per_token": 7.5e-7,
      "our_input_usd_per_token": 2.275e-7,
      "our_output_usd_per_token": 9.75e-7,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image->text\",\"input_modalities\":[\"text\",\"image\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":131072,\"max_completion_tokens\":117964,\"is_moderated\":false},\"supported_parameters\":[\"frequency_penalty\",\"include_reasoning\",\"logit_bias\",\"logprobs\",\"max_tokens\",\"min_p\",\"presence_penalty\",\"reasoning\",\"reasoning_effort\",\"repetition_penalty\",\"response_format\",\"stop\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"top_k\",\"top_logprobs\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-08-29T00:00:43.742Z"
    },
    {
      "id": "meta/muse-spark-1.1",
      "name": "Meta: Muse Spark 1.1",
      "description": "Muse Spark 1.1 is a multimodal reasoning model from Meta, built for agentic tasks. It accepts text, images, video, audio, and PDF documents and returns text, with a 1M-token context...",
      "provider": "meta",
      "context_length": 1048576,
      "upstream_input_usd_per_token": 0.00000125,
      "upstream_output_usd_per_token": 0.00000425,
      "our_input_usd_per_token": 0.0000016250000000000001,
      "our_output_usd_per_token": 0.0000055250000000000005,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+file+audio+video->text\",\"input_modalities\":[\"text\",\"image\",\"video\",\"file\",\"audio\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1048576,\"max_completion_tokens\":943718,\"is_moderated\":true},\"supported_parameters\":[\"include_reasoning\",\"max_tokens\",\"reasoning\",\"reasoning_effort\",\"repetition_penalty\",\"response_format\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"top_k\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-07-17T00:00:08.973Z"
    },
    {
      "id": "meta/muse-spark-1.2",
      "name": "Meta: Muse Spark 1.2",
      "description": "Muse Spark 1.2 is a reasoning model from Meta, designed for complex agentic tasks. It accepts text, images, video, audio, and PDF documents, returns text, and offers a 1M-token context...",
      "provider": "meta",
      "context_length": 1048576,
      "upstream_input_usd_per_token": 0.00000125,
      "upstream_output_usd_per_token": 0.00000425,
      "our_input_usd_per_token": 0.0000016250000000000001,
      "our_output_usd_per_token": 0.0000055250000000000005,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+file+audio+video->text\",\"input_modalities\":[\"text\",\"image\",\"video\",\"file\",\"audio\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1048576,\"max_completion_tokens\":943718,\"is_moderated\":true},\"supported_parameters\":[\"include_reasoning\",\"max_tokens\",\"reasoning\",\"reasoning_effort\",\"repetition_penalty\",\"response_format\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"top_k\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-08-06T00:00:30.403Z"
    },
    {
      "id": "meta/muse-spark-1.2-contributor",
      "name": "Meta: Muse Spark 1.2 Contributor",
      "description": "Muse Spark 1.2 contributor tier is a reasoning model from Meta designed for developers who want to start building at an even lower cost. It’s meaningfully cheaper than Muse Spark...",
      "provider": "meta",
      "context_length": 1048576,
      "upstream_input_usd_per_token": 1e-7,
      "upstream_output_usd_per_token": 2e-7,
      "our_input_usd_per_token": 1.3e-7,
      "our_output_usd_per_token": 2.6e-7,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+file+audio+video->text\",\"input_modalities\":[\"text\",\"image\",\"video\",\"file\",\"audio\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1048576,\"max_completion_tokens\":943718,\"is_moderated\":true},\"supported_parameters\":[\"include_reasoning\",\"max_tokens\",\"reasoning\",\"reasoning_effort\",\"repetition_penalty\",\"response_format\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"top_k\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-08-22T00:00:08.464Z"
    },
    {
      "id": "meta/muse-spark-1.3",
      "name": "Meta: Muse Spark 1.3",
      "description": "Muse Spark 1.3 is a multimodal reasoning model from Meta for long-running agentic, multi-agent, and coding workflows. It is designed to keep track of information across extended tasks, work through...",
      "provider": "meta",
      "context_length": 1048576,
      "upstream_input_usd_per_token": 0.00000125,
      "upstream_output_usd_per_token": 0.00000425,
      "our_input_usd_per_token": 0.0000016250000000000001,
      "our_output_usd_per_token": 0.0000055250000000000005,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+file+audio+video->text\",\"input_modalities\":[\"text\",\"image\",\"video\",\"file\",\"audio\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1048576,\"max_completion_tokens\":943718,\"is_moderated\":true},\"supported_parameters\":[\"include_reasoning\",\"max_tokens\",\"reasoning\",\"reasoning_effort\",\"repetition_penalty\",\"response_format\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"top_k\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-09-03T00:00:33.617Z"
    },
    {
      "id": "meta/muse-spark-1.3-contributor",
      "name": "Meta: Muse Spark 1.3 Contributor",
      "description": "Muse Spark 1.3 Contributor is the cost-efficient contributor tier of Meta’s multimodal reasoning model for experimentation, learning, and early-stage agentic, multi-agent, and coding workflows. It is designed to track information...",
      "provider": "meta",
      "context_length": 1048576,
      "upstream_input_usd_per_token": 1e-7,
      "upstream_output_usd_per_token": 2e-7,
      "our_input_usd_per_token": 1.3e-7,
      "our_output_usd_per_token": 2.6e-7,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+file+audio+video->text\",\"input_modalities\":[\"text\",\"image\",\"video\",\"file\",\"audio\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1048576,\"max_completion_tokens\":943718,\"is_moderated\":true},\"supported_parameters\":[\"include_reasoning\",\"max_tokens\",\"reasoning\",\"reasoning_effort\",\"repetition_penalty\",\"response_format\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"top_k\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-09-03T00:00:33.617Z"
    },
    {
      "id": "moonshotai/kimi-k2.7-code",
      "name": "MoonshotAI: Kimi K2.7 Code",
      "description": "MoonshotAI: Kimi K2.7 Code is a coding-focused model in Moonshot AI's Kimi K2 family, built to complete end-to-end programming tasks reliably over long contexts. It uses a native multimodal mixture-of-experts...",
      "provider": "moonshotai",
      "context_length": 262144,
      "upstream_input_usd_per_token": 7.1e-7,
      "upstream_output_usd_per_token": 0.0000035,
      "our_input_usd_per_token": 9.23e-7,
      "our_output_usd_per_token": 0.0000045500000000000005,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image->text\",\"input_modalities\":[\"text\",\"image\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":262144,\"max_completion_tokens\":235929,\"is_moderated\":false},\"supported_parameters\":[\"frequency_penalty\",\"include_reasoning\",\"logit_bias\",\"logprobs\",\"max_tokens\",\"min_p\",\"parallel_tool_calls\",\"presence_penalty\",\"reasoning\",\"repetition_penalty\",\"response_format\",\"seed\",\"stop\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"top_k\",\"top_logprobs\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-06-12T18:00:32.281Z"
    },
    {
      "id": "moonshotai/kimi-k3",
      "name": "MoonshotAI: Kimi K3",
      "description": "Kimi K3 is a 2.8T parameter open-weight multimodal reasoning model from Moonshot AI. It is suited for complex coding, knowledge work, and long-horizon agentic workflows, and is particularly strong at...",
      "provider": "moonshotai",
      "context_length": 1048576,
      "upstream_input_usd_per_token": 0.000002648138063,
      "upstream_output_usd_per_token": 0.00001328272425,
      "our_input_usd_per_token": 0.0000034425794819,
      "our_output_usd_per_token": 0.000017267541525000002,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+video->text\",\"input_modalities\":[\"text\",\"image\",\"video\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1048576,\"max_completion_tokens\":943718,\"is_moderated\":false},\"supported_parameters\":[\"frequency_penalty\",\"include_reasoning\",\"logit_bias\",\"logprobs\",\"max_tokens\",\"min_p\",\"presence_penalty\",\"reasoning\",\"reasoning_effort\",\"repetition_penalty\",\"response_format\",\"seed\",\"stop\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"top_k\",\"top_logprobs\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-07-17T00:00:08.973Z"
    },
    {
      "id": "moonshotai/kimi-k3:batch",
      "name": "MoonshotAI: Kimi K3 (batch)",
      "description": "Kimi K3 is a 2.8T parameter open-weight multimodal reasoning model from Moonshot AI. It is suited for complex coding, knowledge work, and long-horizon agentic workflows, and is particularly strong at...",
      "provider": "moonshotai",
      "context_length": 1048576,
      "upstream_input_usd_per_token": 0.000003,
      "upstream_output_usd_per_token": 0.000015,
      "our_input_usd_per_token": 0.0000039,
      "our_output_usd_per_token": 0.0000195,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+video->text\",\"input_modalities\":[\"text\",\"image\",\"video\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1048576,\"max_completion_tokens\":943718,\"is_moderated\":false},\"supported_parameters\":[\"frequency_penalty\",\"include_reasoning\",\"logit_bias\",\"max_tokens\",\"min_p\",\"presence_penalty\",\"reasoning\",\"reasoning_effort\",\"repetition_penalty\",\"response_format\",\"stop\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"top_k\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-08-29T00:00:43.742Z"
    },
    {
      "id": "nex-agi/nex-n2.5-mini:free",
      "name": "Nex AGI: Nex-N2.5-Mini (free)",
      "description": "Nex-N2.5 is an agentic model built to turn goals into working, verified outcomes. Its core strength is agentic coding within a visual feedback loop: it can explore codebases, implement multi-file...",
      "provider": "nex-agi",
      "context_length": 262144,
      "upstream_input_usd_per_token": 0,
      "upstream_output_usd_per_token": 0,
      "our_input_usd_per_token": 0,
      "our_output_usd_per_token": 0,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image->text\",\"input_modalities\":[\"text\",\"image\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Qwen3\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":262144,\"max_completion_tokens\":235929,\"is_moderated\":false},\"supported_parameters\":[\"include_reasoning\",\"logprobs\",\"max_tokens\",\"reasoning\",\"reasoning_effort\",\"response_format\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"top_k\",\"top_logprobs\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-09-09T00:00:22.381Z"
    },
    {
      "id": "nex-agi/nex-n2.5-pro:free",
      "name": "Nex AGI: Nex-N2.5-Pro (free)",
      "description": "Nex-N2.5 is an agentic model built to turn goals into working, verified outcomes. Its core strength is agentic coding within a visual feedback loop: it can explore codebases, implement multi-file...",
      "provider": "nex-agi",
      "context_length": 262144,
      "upstream_input_usd_per_token": 0,
      "upstream_output_usd_per_token": 0,
      "our_input_usd_per_token": 0,
      "our_output_usd_per_token": 0,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image->text\",\"input_modalities\":[\"text\",\"image\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Qwen3\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":262144,\"max_completion_tokens\":235929,\"is_moderated\":false},\"supported_parameters\":[\"include_reasoning\",\"logprobs\",\"max_tokens\",\"reasoning\",\"reasoning_effort\",\"response_format\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"top_k\",\"top_logprobs\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-09-09T00:00:22.381Z"
    },
    {
      "id": "nvidia/nemotron-3-ultra-550b-a55b",
      "name": "NVIDIA: Nemotron 3 Ultra",
      "description": "NVIDIA Nemotron 3 Ultra is an open frontier-reasoning and orchestration model from NVIDIA, with 55B active parameters out of 550B total (MoE). Built on a hybrid Transformer-Mamba mixture-of-experts architecture, it...",
      "provider": "nvidia",
      "context_length": 262144,
      "upstream_input_usd_per_token": 6.25e-7,
      "upstream_output_usd_per_token": 0.000003125,
      "our_input_usd_per_token": 8.125000000000001e-7,
      "our_output_usd_per_token": 0.0000040625000000000005,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text->text\",\"input_modalities\":[\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":256000,\"max_completion_tokens\":32768,\"is_moderated\":false},\"supported_parameters\":[\"frequency_penalty\",\"include_reasoning\",\"logit_bias\",\"max_tokens\",\"min_p\",\"presence_penalty\",\"reasoning\",\"reasoning_effort\",\"repetition_penalty\",\"response_format\",\"seed\",\"stop\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"top_k\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-06-04T18:00:13.427Z"
    },
    {
      "id": "nvidia/nemotron-3.5-content-safety",
      "name": "NVIDIA: Nemotron 3.5 Content Safety",
      "description": "NVIDIA Nemotron 3.5 Content Safety is a compact 4B-parameter multimodal guardrail model from NVIDIA, fine-tuned from Google Gemma-3-4B. It moderates both inputs to and responses from LLMs and VLMs, accepting...",
      "provider": "nvidia",
      "context_length": 131072,
      "upstream_input_usd_per_token": 2e-7,
      "upstream_output_usd_per_token": 2e-7,
      "our_input_usd_per_token": 2.6e-7,
      "our_output_usd_per_token": 2.6e-7,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image->text\",\"input_modalities\":[\"text\",\"image\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":131072,\"max_completion_tokens\":117964,\"is_moderated\":false},\"supported_parameters\":[\"frequency_penalty\",\"include_reasoning\",\"logit_bias\",\"max_tokens\",\"min_p\",\"presence_penalty\",\"reasoning\",\"repetition_penalty\",\"response_format\",\"seed\",\"stop\",\"temperature\",\"top_k\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-09-04T00:00:33.613Z"
    },
    {
      "id": "nvidia/nemotron-3.5-content-safety:free",
      "name": "NVIDIA: Nemotron 3.5 Content Safety (free)",
      "description": "NVIDIA Nemotron 3.5 Content Safety is a compact 4B-parameter multimodal guardrail model from NVIDIA, fine-tuned from Google Gemma-3-4B. It moderates both inputs to and responses from LLMs and VLMs, accepting...",
      "provider": "nvidia",
      "context_length": 128000,
      "upstream_input_usd_per_token": 0,
      "upstream_output_usd_per_token": 0,
      "our_input_usd_per_token": 0,
      "our_output_usd_per_token": 0,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image->text\",\"input_modalities\":[\"text\",\"image\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":128000,\"max_completion_tokens\":8192,\"is_moderated\":false},\"supported_parameters\":[\"include_reasoning\",\"max_tokens\",\"reasoning\",\"seed\",\"temperature\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-06-04T18:00:13.427Z"
    },
    {
      "id": "nvidia/nemotron-3.5-lightning",
      "name": "NVIDIA: Nemotron 3.5 Lightning",
      "description": "NVIDIA Nemotron 3.5 Lightning is an open mixture-of-experts model from NVIDIA, with 3B active parameters out of 30B total. It is suited for high-throughput agentic workloads and specialized tasks that...",
      "provider": "nvidia",
      "context_length": 262144,
      "upstream_input_usd_per_token": 8e-8,
      "upstream_output_usd_per_token": 2e-7,
      "our_input_usd_per_token": 1.04e-7,
      "our_output_usd_per_token": 2.6e-7,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text->text\",\"input_modalities\":[\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":262144,\"max_completion_tokens\":131072,\"is_moderated\":false},\"supported_parameters\":[\"frequency_penalty\",\"include_reasoning\",\"logit_bias\",\"logprobs\",\"max_tokens\",\"min_p\",\"presence_penalty\",\"reasoning\",\"repetition_penalty\",\"response_format\",\"seed\",\"stop\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"top_k\",\"top_logprobs\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-08-11T18:00:38.248Z"
    },
    {
      "id": "nvidia/nemotron-3.5-lightning:free",
      "name": "NVIDIA: Nemotron 3.5 Lightning (free)",
      "description": "NVIDIA Nemotron 3.5 Lightning is an open mixture-of-experts model from NVIDIA, with 3B active parameters out of 30B total. It is suited for high-throughput agentic workloads and specialized tasks that...",
      "provider": "nvidia",
      "context_length": 1000000,
      "upstream_input_usd_per_token": 0,
      "upstream_output_usd_per_token": 0,
      "our_input_usd_per_token": 0,
      "our_output_usd_per_token": 0,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text->text\",\"input_modalities\":[\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1000000,\"max_completion_tokens\":65536,\"is_moderated\":false},\"supported_parameters\":[\"include_reasoning\",\"max_tokens\",\"reasoning\",\"seed\",\"temperature\",\"tool_choice\",\"tools\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-08-11T18:00:38.248Z"
    },
    {
      "id": "openai/gpt-5.6-luna",
      "name": "OpenAI: GPT-5.6 Luna",
      "description": "GPT-5.6 Luna is a fast, cost-efficient model in OpenAI's GPT-5.6 series. It is suited for high-volume, latency-sensitive tasks such as chat, classification, and lightweight agentic workflows, providing capable reasoning for...",
      "provider": "openai",
      "context_length": 1050000,
      "upstream_input_usd_per_token": 2e-7,
      "upstream_output_usd_per_token": 0.0000012,
      "our_input_usd_per_token": 2.6e-7,
      "our_output_usd_per_token": 0.0000015599999999999999,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+file->text\",\"input_modalities\":[\"file\",\"image\",\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"GPT\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1050000,\"max_completion_tokens\":128000,\"is_moderated\":true},\"supported_parameters\":[\"include_reasoning\",\"max_completion_tokens\",\"max_tokens\",\"reasoning\",\"reasoning_effort\",\"response_format\",\"seed\",\"structured_outputs\",\"tool_choice\",\"tools\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-07-09T18:00:59.522Z"
    },
    {
      "id": "openai/gpt-5.6-luna-pro",
      "name": "OpenAI: GPT-5.6 Luna Pro",
      "description": "GPT-5.6 Luna Pro is the same underlying model as [GPT-5.6 Luna](https://openrouter.ai/openai/gpt-5.6-luna), served with `reasoning.mode` set to `pro` for higher-quality responses on complex tasks.\n\nLearn more in OpenAI's docs: https://developers.openai.com/api/docs/guides/reasoning#reasoning-mode",
      "provider": "openai",
      "context_length": 1050000,
      "upstream_input_usd_per_token": 2e-7,
      "upstream_output_usd_per_token": 0.0000012,
      "our_input_usd_per_token": 2.6e-7,
      "our_output_usd_per_token": 0.0000015599999999999999,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+file->text\",\"input_modalities\":[\"file\",\"image\",\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"GPT\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1050000,\"max_completion_tokens\":128000,\"is_moderated\":true},\"supported_parameters\":[\"include_reasoning\",\"max_completion_tokens\",\"max_tokens\",\"reasoning\",\"reasoning_effort\",\"response_format\",\"seed\",\"structured_outputs\",\"tool_choice\",\"tools\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-07-09T18:00:59.522Z"
    },
    {
      "id": "openai/gpt-5.6-luna-pro:batch",
      "name": "OpenAI: GPT-5.6 Luna Pro (batch)",
      "description": "GPT-5.6 Luna Pro is the same underlying model as [GPT-5.6 Luna](https://openrouter.ai/openai/gpt-5.6-luna), served with `reasoning.mode` set to `pro` for higher-quality responses on complex tasks.\n\nLearn more in OpenAI's docs: https://developers.openai.com/api/docs/guides/reasoning#reasoning-mode",
      "provider": "openai",
      "context_length": 1050000,
      "upstream_input_usd_per_token": 1e-7,
      "upstream_output_usd_per_token": 6e-7,
      "our_input_usd_per_token": 1.3e-7,
      "our_output_usd_per_token": 7.799999999999999e-7,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+file->text\",\"input_modalities\":[\"file\",\"image\",\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"GPT\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1050000,\"max_completion_tokens\":128000,\"is_moderated\":true},\"supported_parameters\":[\"include_reasoning\",\"max_tokens\",\"reasoning\",\"reasoning_effort\",\"response_format\",\"seed\",\"structured_outputs\",\"tool_choice\",\"tools\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-08-06T18:00:30.413Z"
    },
    {
      "id": "openai/gpt-5.6-luna:batch",
      "name": "OpenAI: GPT-5.6 Luna (batch)",
      "description": "GPT-5.6 Luna is a fast, cost-efficient model in OpenAI's GPT-5.6 series. It is suited for high-volume, latency-sensitive tasks such as chat, classification, and lightweight agentic workflows, providing capable reasoning for...",
      "provider": "openai",
      "context_length": 1050000,
      "upstream_input_usd_per_token": 1e-7,
      "upstream_output_usd_per_token": 6e-7,
      "our_input_usd_per_token": 1.3e-7,
      "our_output_usd_per_token": 7.799999999999999e-7,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+file->text\",\"input_modalities\":[\"file\",\"image\",\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"GPT\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1050000,\"max_completion_tokens\":128000,\"is_moderated\":true},\"supported_parameters\":[\"include_reasoning\",\"max_tokens\",\"reasoning\",\"reasoning_effort\",\"response_format\",\"seed\",\"structured_outputs\",\"tool_choice\",\"tools\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-08-06T18:00:30.413Z"
    },
    {
      "id": "openai/gpt-5.6-sol",
      "name": "OpenAI: GPT-5.6 Sol",
      "description": "GPT-5.6 Sol is the flagship model in OpenAI's GPT-5.6 series. It is suited for complex reasoning, coding, and agentic workflows, and is particularly strong at command-line and multi-step coding tasks...",
      "provider": "openai",
      "context_length": 1050000,
      "upstream_input_usd_per_token": 0.000002,
      "upstream_output_usd_per_token": 0.00001,
      "our_input_usd_per_token": 0.0000026,
      "our_output_usd_per_token": 0.000013000000000000001,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+file->text\",\"input_modalities\":[\"file\",\"image\",\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"GPT\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1050000,\"max_completion_tokens\":128000,\"is_moderated\":true},\"supported_parameters\":[\"include_reasoning\",\"max_completion_tokens\",\"max_tokens\",\"reasoning\",\"reasoning_effort\",\"response_format\",\"seed\",\"structured_outputs\",\"tool_choice\",\"tools\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-07-09T18:00:59.522Z"
    },
    {
      "id": "openai/gpt-5.6-sol-pro",
      "name": "OpenAI: GPT-5.6 Sol Pro",
      "description": "GPT-5.6 Sol Pro is the same underlying model as [GPT-5.6 Sol](https://openrouter.ai/openai/gpt-5.6-sol), served with `reasoning.mode` set to `pro` for higher-quality responses on complex tasks.\n\nLearn more in OpenAI's docs: https://developers.openai.com/api/docs/guides/reasoning#reasoning-mode",
      "provider": "openai",
      "context_length": 1050000,
      "upstream_input_usd_per_token": 0.000002,
      "upstream_output_usd_per_token": 0.00001,
      "our_input_usd_per_token": 0.0000026,
      "our_output_usd_per_token": 0.000013000000000000001,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+file->text\",\"input_modalities\":[\"file\",\"image\",\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"GPT\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1050000,\"max_completion_tokens\":128000,\"is_moderated\":true},\"supported_parameters\":[\"include_reasoning\",\"max_completion_tokens\",\"max_tokens\",\"reasoning\",\"reasoning_effort\",\"response_format\",\"seed\",\"structured_outputs\",\"tool_choice\",\"tools\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-07-09T18:00:59.522Z"
    },
    {
      "id": "openai/gpt-5.6-sol-pro:batch",
      "name": "OpenAI: GPT-5.6 Sol Pro (batch)",
      "description": "GPT-5.6 Sol Pro is the same underlying model as [GPT-5.6 Sol](https://openrouter.ai/openai/gpt-5.6-sol), served with `reasoning.mode` set to `pro` for higher-quality responses on complex tasks.\n\nLearn more in OpenAI's docs: https://developers.openai.com/api/docs/guides/reasoning#reasoning-mode",
      "provider": "openai",
      "context_length": 1050000,
      "upstream_input_usd_per_token": 0.000001,
      "upstream_output_usd_per_token": 0.000005,
      "our_input_usd_per_token": 0.0000013,
      "our_output_usd_per_token": 0.0000065000000000000004,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+file->text\",\"input_modalities\":[\"file\",\"image\",\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"GPT\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1050000,\"max_completion_tokens\":128000,\"is_moderated\":true},\"supported_parameters\":[\"include_reasoning\",\"max_tokens\",\"reasoning\",\"reasoning_effort\",\"response_format\",\"seed\",\"structured_outputs\",\"tool_choice\",\"tools\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-08-06T18:00:30.413Z"
    },
    {
      "id": "openai/gpt-5.6-sol:batch",
      "name": "OpenAI: GPT-5.6 Sol (batch)",
      "description": "GPT-5.6 Sol is the flagship model in OpenAI's GPT-5.6 series. It is suited for complex reasoning, coding, and agentic workflows, and is particularly strong at command-line and multi-step coding tasks...",
      "provider": "openai",
      "context_length": 1050000,
      "upstream_input_usd_per_token": 0.000001,
      "upstream_output_usd_per_token": 0.000005,
      "our_input_usd_per_token": 0.0000013,
      "our_output_usd_per_token": 0.0000065000000000000004,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+file->text\",\"input_modalities\":[\"file\",\"image\",\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"GPT\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1050000,\"max_completion_tokens\":128000,\"is_moderated\":true},\"supported_parameters\":[\"include_reasoning\",\"max_tokens\",\"reasoning\",\"reasoning_effort\",\"response_format\",\"seed\",\"structured_outputs\",\"tool_choice\",\"tools\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-08-06T18:00:30.413Z"
    },
    {
      "id": "openai/gpt-5.6-terra",
      "name": "OpenAI: GPT-5.6 Terra",
      "description": "GPT-5.6 Terra is a balanced model in OpenAI's GPT-5.6 series, positioned between the flagship Sol tier and the cost-efficient Luna tier. It is suited for everyday coding, reasoning, and agentic...",
      "provider": "openai",
      "context_length": 1050000,
      "upstream_input_usd_per_token": 0.000002,
      "upstream_output_usd_per_token": 0.000012,
      "our_input_usd_per_token": 0.0000026,
      "our_output_usd_per_token": 0.0000156,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+file->text\",\"input_modalities\":[\"file\",\"image\",\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"GPT\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1050000,\"max_completion_tokens\":128000,\"is_moderated\":true},\"supported_parameters\":[\"include_reasoning\",\"max_completion_tokens\",\"max_tokens\",\"reasoning\",\"reasoning_effort\",\"response_format\",\"seed\",\"structured_outputs\",\"tool_choice\",\"tools\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-07-09T18:00:59.522Z"
    },
    {
      "id": "openai/gpt-5.6-terra-pro",
      "name": "OpenAI: GPT-5.6 Terra Pro",
      "description": "GPT-5.6 Terra Pro is the same underlying model as [GPT-5.6 Terra](https://openrouter.ai/openai/gpt-5.6-terra), served with `reasoning.mode` set to `pro` for higher-quality responses on complex tasks.\n\nLearn more in OpenAI's docs: https://developers.openai.com/api/docs/guides/reasoning#reasoning-mode",
      "provider": "openai",
      "context_length": 1050000,
      "upstream_input_usd_per_token": 0.000002,
      "upstream_output_usd_per_token": 0.000012,
      "our_input_usd_per_token": 0.0000026,
      "our_output_usd_per_token": 0.0000156,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+file->text\",\"input_modalities\":[\"file\",\"image\",\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"GPT\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1050000,\"max_completion_tokens\":128000,\"is_moderated\":true},\"supported_parameters\":[\"include_reasoning\",\"max_completion_tokens\",\"max_tokens\",\"reasoning\",\"reasoning_effort\",\"response_format\",\"seed\",\"structured_outputs\",\"tool_choice\",\"tools\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-07-09T18:00:59.522Z"
    },
    {
      "id": "openai/gpt-5.6-terra-pro:batch",
      "name": "OpenAI: GPT-5.6 Terra Pro (batch)",
      "description": "GPT-5.6 Terra Pro is the same underlying model as [GPT-5.6 Terra](https://openrouter.ai/openai/gpt-5.6-terra), served with `reasoning.mode` set to `pro` for higher-quality responses on complex tasks.\n\nLearn more in OpenAI's docs: https://developers.openai.com/api/docs/guides/reasoning#reasoning-mode",
      "provider": "openai",
      "context_length": 1050000,
      "upstream_input_usd_per_token": 0.000001,
      "upstream_output_usd_per_token": 0.000006,
      "our_input_usd_per_token": 0.0000013,
      "our_output_usd_per_token": 0.0000078,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+file->text\",\"input_modalities\":[\"file\",\"image\",\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"GPT\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1050000,\"max_completion_tokens\":128000,\"is_moderated\":true},\"supported_parameters\":[\"include_reasoning\",\"max_tokens\",\"reasoning\",\"reasoning_effort\",\"response_format\",\"seed\",\"structured_outputs\",\"tool_choice\",\"tools\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-08-06T18:00:30.413Z"
    },
    {
      "id": "openai/gpt-5.6-terra:batch",
      "name": "OpenAI: GPT-5.6 Terra (batch)",
      "description": "GPT-5.6 Terra is a balanced model in OpenAI's GPT-5.6 series, positioned between the flagship Sol tier and the cost-efficient Luna tier. It is suited for everyday coding, reasoning, and agentic...",
      "provider": "openai",
      "context_length": 1050000,
      "upstream_input_usd_per_token": 0.000001,
      "upstream_output_usd_per_token": 0.000006,
      "our_input_usd_per_token": 0.0000013,
      "our_output_usd_per_token": 0.0000078,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+file->text\",\"input_modalities\":[\"file\",\"image\",\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"GPT\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1050000,\"max_completion_tokens\":128000,\"is_moderated\":true},\"supported_parameters\":[\"include_reasoning\",\"max_tokens\",\"reasoning\",\"reasoning_effort\",\"response_format\",\"seed\",\"structured_outputs\",\"tool_choice\",\"tools\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-08-06T18:00:30.413Z"
    },
    {
      "id": "openai/gpt-6-astra",
      "name": "OpenAI: GPT-6 Astra",
      "description": "GPT-6 Astra is OpenAI's flagship model for demanding end-to-end work. It is suited for advanced analysis, software engineering, deep research, scientific work, and document creation, with particular strengths in long-horizon...",
      "provider": "openai",
      "context_length": 1050000,
      "upstream_input_usd_per_token": 0.00001,
      "upstream_output_usd_per_token": 0.00005,
      "our_input_usd_per_token": 0.000013000000000000001,
      "our_output_usd_per_token": 0.00006500000000000001,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+file->text\",\"input_modalities\":[\"file\",\"image\",\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"GPT\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1050000,\"max_completion_tokens\":128000,\"is_moderated\":true},\"supported_parameters\":[\"include_reasoning\",\"max_completion_tokens\",\"max_tokens\",\"reasoning\",\"reasoning_effort\",\"response_format\",\"seed\",\"structured_outputs\",\"tool_choice\",\"tools\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-09-05T00:00:33.612Z"
    },
    {
      "id": "openai/gpt-6-astra-pro",
      "name": "OpenAI: GPT-6 Astra Pro",
      "description": "GPT-6 Astra Pro is the same underlying model as [GPT-6 Astra](https://openrouter.ai/openai/gpt-6-astra), served with `reasoning.mode` set to `pro` for higher-quality responses on complex tasks.\n\nLearn more in OpenAI's docs: https://developers.openai.com/api/docs/guides/reasoning#reasoning-mode",
      "provider": "openai",
      "context_length": 1050000,
      "upstream_input_usd_per_token": 0.00001,
      "upstream_output_usd_per_token": 0.00005,
      "our_input_usd_per_token": 0.000013000000000000001,
      "our_output_usd_per_token": 0.00006500000000000001,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+file->text\",\"input_modalities\":[\"file\",\"image\",\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"GPT\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1050000,\"max_completion_tokens\":128000,\"is_moderated\":false},\"supported_parameters\":[\"include_reasoning\",\"max_completion_tokens\",\"max_tokens\",\"reasoning\",\"reasoning_effort\",\"response_format\",\"seed\",\"structured_outputs\",\"tool_choice\",\"tools\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-09-05T00:00:33.612Z"
    },
    {
      "id": "openai/gpt-6-astra-pro:batch",
      "name": "OpenAI: GPT-6 Astra Pro (batch)",
      "description": "GPT-6 Astra Pro is the same underlying model as [GPT-6 Astra](https://openrouter.ai/openai/gpt-6-astra), served with `reasoning.mode` set to `pro` for higher-quality responses on complex tasks.\n\nLearn more in OpenAI's docs: https://developers.openai.com/api/docs/guides/reasoning#reasoning-mode",
      "provider": "openai",
      "context_length": 1050000,
      "upstream_input_usd_per_token": 0.000005,
      "upstream_output_usd_per_token": 0.000025,
      "our_input_usd_per_token": 0.0000065000000000000004,
      "our_output_usd_per_token": 0.000032500000000000004,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+file->text\",\"input_modalities\":[\"file\",\"image\",\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"GPT\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1050000,\"max_completion_tokens\":128000,\"is_moderated\":true},\"supported_parameters\":[\"include_reasoning\",\"max_tokens\",\"reasoning\",\"reasoning_effort\",\"response_format\",\"seed\",\"structured_outputs\",\"tool_choice\",\"tools\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-09-05T00:00:33.612Z"
    },
    {
      "id": "openai/gpt-6-astra:batch",
      "name": "OpenAI: GPT-6 Astra (batch)",
      "description": "GPT-6 Astra is OpenAI's flagship model for demanding end-to-end work. It is suited for advanced analysis, software engineering, deep research, scientific work, and document creation, with particular strengths in long-horizon...",
      "provider": "openai",
      "context_length": 1050000,
      "upstream_input_usd_per_token": 0.000005,
      "upstream_output_usd_per_token": 0.000025,
      "our_input_usd_per_token": 0.0000065000000000000004,
      "our_output_usd_per_token": 0.000032500000000000004,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+file->text\",\"input_modalities\":[\"file\",\"image\",\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"GPT\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1050000,\"max_completion_tokens\":128000,\"is_moderated\":true},\"supported_parameters\":[\"include_reasoning\",\"max_tokens\",\"reasoning\",\"reasoning_effort\",\"response_format\",\"seed\",\"structured_outputs\",\"tool_choice\",\"tools\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-09-05T00:00:33.612Z"
    },
    {
      "id": "openrouter/auto-beta",
      "name": "Auto Router (Beta)",
      "description": "Auto Router (Beta) is a task-aware router from OpenRouter. It classifies each request, then routes it the [most popular model](/rankings#task-spend) for that task based on aggregate spend, filtered by your...",
      "provider": "openrouter",
      "context_length": 2000000,
      "upstream_input_usd_per_token": 0,
      "upstream_output_usd_per_token": 0,
      "our_input_usd_per_token": 0,
      "our_output_usd_per_token": 0,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+file+audio+video->text+image\",\"input_modalities\":[\"text\",\"image\",\"audio\",\"file\",\"video\"],\"output_modalities\":[\"text\",\"image\"],\"tokenizer\":\"Router\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":null,\"max_completion_tokens\":null,\"is_moderated\":false},\"supported_parameters\":[\"frequency_penalty\",\"include_reasoning\",\"logit_bias\",\"logprobs\",\"max_tokens\",\"min_p\",\"prediction\",\"presence_penalty\",\"reasoning\",\"reasoning_effort\",\"repetition_penalty\",\"response_format\",\"seed\",\"stop\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"top_a\",\"top_k\",\"top_logprobs\",\"top_p\",\"web_search_options\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-07-18T00:00:56.979Z"
    },
    {
      "id": "openrouter/fusion",
      "name": "OpenRouter: Fusion",
      "description": "Fusion turns your prompt into a small multi-model deliberation. A panel of expert models (see below) analyzes your prompt in parallel with web search and web fetch enabled, then a...",
      "provider": "openrouter",
      "context_length": 1000000,
      "upstream_input_usd_per_token": 0,
      "upstream_output_usd_per_token": 0,
      "our_input_usd_per_token": 0,
      "our_output_usd_per_token": 0,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text->text\",\"input_modalities\":[\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Router\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":null,\"max_completion_tokens\":null,\"is_moderated\":false},\"supported_parameters\":[]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-06-03T00:00:41.358Z"
    },
    {
      "id": "poolside/laguna-s-2.1",
      "name": "Poolside: Laguna S 2.1",
      "description": "Laguna S 2.1 is the latest coding agent model from [Poolside](<https://poolside.ai/>). Laguna S 2.1 is a 118B total parameter model with 8B active parameters, scoring 70.2% on Terminal-Bench 2.1 and...",
      "provider": "poolside",
      "context_length": 1048576,
      "upstream_input_usd_per_token": 9e-8,
      "upstream_output_usd_per_token": 1.8e-7,
      "our_input_usd_per_token": 1.17e-7,
      "our_output_usd_per_token": 2.34e-7,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text->text\",\"input_modalities\":[\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1048576,\"max_completion_tokens\":131072,\"is_moderated\":false},\"supported_parameters\":[\"include_reasoning\",\"max_tokens\",\"reasoning\",\"temperature\",\"tool_choice\",\"tools\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-07-21T18:00:32.149Z"
    },
    {
      "id": "poolside/laguna-s-2.1:free",
      "name": "Poolside: Laguna S 2.1 (free)",
      "description": "Laguna S 2.1 is the latest coding agent model from [Poolside](<https://poolside.ai/>). Laguna S 2.1 is a 118B total parameter model with 8B active parameters, scoring 70.2% on Terminal-Bench 2.1 and...",
      "provider": "poolside",
      "context_length": 262144,
      "upstream_input_usd_per_token": 0,
      "upstream_output_usd_per_token": 0,
      "our_input_usd_per_token": 0,
      "our_output_usd_per_token": 0,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text->text\",\"input_modalities\":[\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":262144,\"max_completion_tokens\":32768,\"is_moderated\":false},\"supported_parameters\":[\"include_reasoning\",\"max_tokens\",\"reasoning\",\"temperature\",\"tool_choice\",\"tools\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-07-21T18:00:32.149Z"
    },
    {
      "id": "poolside/laguna-xs-2.1",
      "name": "Poolside: Laguna XS 2.1",
      "description": "Laguna XS 2.1 is the latest coding agent model in the 33B-A3B category from [Poolside](https://poolside.ai/) and a step forward from their Laguna XS.2 model (released in April 2026). It combines...",
      "provider": "poolside",
      "context_length": 262144,
      "upstream_input_usd_per_token": 6e-8,
      "upstream_output_usd_per_token": 1.2e-7,
      "our_input_usd_per_token": 7.8e-8,
      "our_output_usd_per_token": 1.56e-7,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text->text\",\"input_modalities\":[\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":262144,\"max_completion_tokens\":32768,\"is_moderated\":false},\"supported_parameters\":[\"include_reasoning\",\"max_tokens\",\"reasoning\",\"temperature\",\"tool_choice\",\"tools\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-07-02T18:00:23.303Z"
    },
    {
      "id": "poolside/laguna-xs-2.1:free",
      "name": "Poolside: Laguna XS 2.1 (free)",
      "description": "Laguna XS 2.1 is the latest coding agent model in the 33B-A3B category from [Poolside](https://poolside.ai/) and a step forward from their Laguna XS.2 model (released in April 2026). It combines...",
      "provider": "poolside",
      "context_length": 262144,
      "upstream_input_usd_per_token": 0,
      "upstream_output_usd_per_token": 0,
      "our_input_usd_per_token": 0,
      "our_output_usd_per_token": 0,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text->text\",\"input_modalities\":[\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":262144,\"max_completion_tokens\":32768,\"is_moderated\":false},\"supported_parameters\":[\"include_reasoning\",\"max_tokens\",\"reasoning\",\"temperature\",\"tool_choice\",\"tools\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-07-02T18:00:23.303Z"
    },
    {
      "id": "qwen/qwen3.7-flash",
      "name": "Qwen: Qwen3.7 Flash",
      "description": "Qwen3.7 Flash is a vision-language reasoning model from Alibaba. It is suited for multimodal agents, visual coding, search, and computer interaction, with strengths in object recognition, spatial understanding, and real-world...",
      "provider": "qwen",
      "context_length": 1000000,
      "upstream_input_usd_per_token": 3e-8,
      "upstream_output_usd_per_token": 1.3e-7,
      "our_input_usd_per_token": 3.9e-8,
      "our_output_usd_per_token": 1.6900000000000002e-7,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+video->text\",\"input_modalities\":[\"text\",\"image\",\"video\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Qwen\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1000000,\"max_completion_tokens\":65536,\"is_moderated\":false},\"supported_parameters\":[\"include_reasoning\",\"logprobs\",\"max_tokens\",\"presence_penalty\",\"reasoning\",\"response_format\",\"seed\",\"temperature\",\"tool_choice\",\"tools\",\"top_logprobs\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-07-28T06:01:05.477Z"
    },
    {
      "id": "qwen/qwen3.8-2.4t-a95b",
      "name": "Qwen: Qwen3.8 2.4T A95B",
      "description": "Qwen3.8 2.4T A95B is an open-weight sparse mixture-of-experts model from Qwen and the open-weight variant of [Qwen3.8 Max](/qwen/qwen3.8-max), with 95 billion active parameters out of 2.4 trillion total. It is...",
      "provider": "qwen",
      "context_length": 1048576,
      "upstream_input_usd_per_token": 0.000002,
      "upstream_output_usd_per_token": 0.000006,
      "our_input_usd_per_token": 0.0000026,
      "our_output_usd_per_token": 0.0000078,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text->text\",\"input_modalities\":[\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Qwen\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1000000,\"max_completion_tokens\":131072,\"is_moderated\":false},\"supported_parameters\":[\"frequency_penalty\",\"include_reasoning\",\"logit_bias\",\"logprobs\",\"max_tokens\",\"min_p\",\"presence_penalty\",\"reasoning\",\"reasoning_effort\",\"repetition_penalty\",\"response_format\",\"seed\",\"stop\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"top_k\",\"top_logprobs\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-08-12T18:00:37.453Z"
    },
    {
      "id": "qwen/qwen3.8-2.4t-a95b:batch",
      "name": "Qwen: Qwen3.8 2.4T A95B (batch)",
      "description": "Qwen3.8 2.4T A95B is an open-weight sparse mixture-of-experts model from Qwen and the open-weight variant of [Qwen3.8 Max](/qwen/qwen3.8-max), with 95 billion active parameters out of 2.4 trillion total. It is...",
      "provider": "qwen",
      "context_length": 1010000,
      "upstream_input_usd_per_token": 0.000002,
      "upstream_output_usd_per_token": 0.000006,
      "our_input_usd_per_token": 0.0000026,
      "our_output_usd_per_token": 0.0000078,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text->text\",\"input_modalities\":[\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Qwen\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1010000,\"max_completion_tokens\":909000,\"is_moderated\":false},\"supported_parameters\":[\"frequency_penalty\",\"include_reasoning\",\"logit_bias\",\"logprobs\",\"max_tokens\",\"min_p\",\"presence_penalty\",\"reasoning\",\"reasoning_effort\",\"repetition_penalty\",\"response_format\",\"stop\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"top_k\",\"top_logprobs\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-08-28T18:00:44.034Z"
    },
    {
      "id": "qwen/qwen3.8-27b",
      "name": "Qwen: Qwen3.8 27B",
      "description": "Qwen3.8 27B is an open-weight dense vision-language model from Qwen. It is suited for coding, professional workflows, research, multimodal interaction, and long-running agent tasks, with flexible thinking that can be...",
      "provider": "qwen",
      "context_length": 1000000,
      "upstream_input_usd_per_token": 2.14e-7,
      "upstream_output_usd_per_token": 0.00000255,
      "our_input_usd_per_token": 2.7820000000000004e-7,
      "our_output_usd_per_token": 0.0000033150000000000004,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+video->text\",\"input_modalities\":[\"text\",\"image\",\"video\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Qwen\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":262144,\"max_completion_tokens\":131072,\"is_moderated\":false},\"supported_parameters\":[\"frequency_penalty\",\"include_reasoning\",\"logit_bias\",\"logprobs\",\"max_tokens\",\"min_p\",\"presence_penalty\",\"reasoning\",\"reasoning_effort\",\"repetition_penalty\",\"response_format\",\"seed\",\"stop\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"top_a\",\"top_k\",\"top_logprobs\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-08-15T06:00:34.626Z"
    },
    {
      "id": "qwen/qwen3.8-flash",
      "name": "Qwen: Qwen3.8 Flash",
      "description": "Qwen3.8 Flash is a multimodal reasoning model from Alibaba. It is suited for coding assistance, agentic workflows, visual understanding, document and codebase analysis, desktop interaction, chart analysis, and long-video analysis.",
      "provider": "qwen",
      "context_length": 1000000,
      "upstream_input_usd_per_token": 1.5e-7,
      "upstream_output_usd_per_token": 4.7e-7,
      "our_input_usd_per_token": 1.9499999999999999e-7,
      "our_output_usd_per_token": 6.110000000000001e-7,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+video->text\",\"input_modalities\":[\"text\",\"image\",\"video\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Qwen\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1000000,\"max_completion_tokens\":131072,\"is_moderated\":false},\"supported_parameters\":[\"frequency_penalty\",\"include_reasoning\",\"logit_bias\",\"logprobs\",\"max_tokens\",\"min_p\",\"presence_penalty\",\"reasoning\",\"repetition_penalty\",\"response_format\",\"seed\",\"stop\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"top_k\",\"top_logprobs\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-08-27T00:00:43.754Z"
    },
    {
      "id": "qwen/qwen3.8-max-0902",
      "name": "Qwen: Qwen3.8 Max (0902)",
      "description": "Qwen3.8 Max 0902 is an updated snapshot of Qwen3.8 Max from Alibaba's Qwen team. It is a 2.4-trillion-parameter mixture-of-experts model that accepts text, image, and video input and returns text,...",
      "provider": "qwen",
      "context_length": 1000000,
      "upstream_input_usd_per_token": 0.000002,
      "upstream_output_usd_per_token": 0.000006,
      "our_input_usd_per_token": 0.0000026,
      "our_output_usd_per_token": 0.0000078,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+video->text\",\"input_modalities\":[\"text\",\"image\",\"video\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Qwen\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1000000,\"max_completion_tokens\":131072,\"is_moderated\":false},\"supported_parameters\":[\"frequency_penalty\",\"include_reasoning\",\"logprobs\",\"max_tokens\",\"presence_penalty\",\"reasoning\",\"reasoning_effort\",\"response_format\",\"seed\",\"stop\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"top_k\",\"top_logprobs\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-09-05T06:00:33.645Z"
    },
    {
      "id": "sakana/fugu-max",
      "name": "Sakana: Fugu Max",
      "description": "Fugu Max is the cost-performance model in Sakana AI's Fugu family. Rather than a single monolithic model, Fugu is a learned multi-agent orchestration system: a language model trained to route...",
      "provider": "sakana",
      "context_length": 1000000,
      "upstream_input_usd_per_token": 0.000002,
      "upstream_output_usd_per_token": 0.000006,
      "our_input_usd_per_token": 0.0000026,
      "our_output_usd_per_token": 0.0000078,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+file->text\",\"input_modalities\":[\"text\",\"image\",\"file\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1000000,\"max_completion_tokens\":128000,\"is_moderated\":false},\"supported_parameters\":[\"include_reasoning\",\"reasoning\",\"reasoning_effort\",\"structured_outputs\",\"tool_choice\",\"tools\",\"web_search_options\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-09-11T06:00:16.286Z"
    },
    {
      "id": "sakana/fugu-ultra",
      "name": "Sakana: Fugu Ultra",
      "description": "Fugu Ultra is the higher-performance model in Sakana AI's Fugu family. Rather than a single monolithic model, Fugu is a learned multi-agent orchestration system: a language model trained to route...",
      "provider": "sakana",
      "context_length": 1000000,
      "upstream_input_usd_per_token": 0.000005,
      "upstream_output_usd_per_token": 0.00003,
      "our_input_usd_per_token": 0.0000065000000000000004,
      "our_output_usd_per_token": 0.000039,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image->text\",\"input_modalities\":[\"text\",\"image\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1000000,\"max_completion_tokens\":128000,\"is_moderated\":false},\"supported_parameters\":[\"include_reasoning\",\"reasoning\",\"reasoning_effort\",\"structured_outputs\",\"tool_choice\",\"tools\",\"web_search_options\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-06-24T06:00:56.964Z"
    },
    {
      "id": "sakana/fugu-ultra-v2",
      "name": "Sakana: Fugu Ultra v2",
      "description": "Fugu Ultra v2 is the higher-performance model in Sakana AI's Fugu family. Rather than a single monolithic model, Fugu is a learned multi-agent orchestration system: a language model trained to...",
      "provider": "sakana",
      "context_length": 1000000,
      "upstream_input_usd_per_token": 0.000005,
      "upstream_output_usd_per_token": 0.00003,
      "our_input_usd_per_token": 0.0000065000000000000004,
      "our_output_usd_per_token": 0.000039,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+file->text\",\"input_modalities\":[\"text\",\"image\",\"file\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1000000,\"max_completion_tokens\":128000,\"is_moderated\":false},\"supported_parameters\":[\"include_reasoning\",\"reasoning\",\"reasoning_effort\",\"structured_outputs\",\"tool_choice\",\"tools\",\"web_search_options\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-09-11T06:00:16.286Z"
    },
    {
      "id": "sakana/sakana-namazu",
      "name": "Sakana: Sakana Namazu",
      "description": "Sakana Namazu is a Japanese-specialized reasoning model from Sakana AI, based on Kimi K2.6 with additional training for Japanese language and business contexts. It is suited for Japanese instruction following,...",
      "provider": "sakana",
      "context_length": 262144,
      "upstream_input_usd_per_token": 9.5e-7,
      "upstream_output_usd_per_token": 0.000004,
      "our_input_usd_per_token": 0.000001235,
      "our_output_usd_per_token": 0.0000052,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+file->text\",\"input_modalities\":[\"text\",\"image\",\"file\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":262144,\"max_completion_tokens\":65536,\"is_moderated\":false},\"supported_parameters\":[\"include_reasoning\",\"reasoning\",\"reasoning_effort\",\"structured_outputs\",\"tool_choice\",\"tools\",\"web_search_options\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-08-11T06:00:41.514Z"
    },
    {
      "id": "shared-local/up_lenovo_rtx8000_ollama/nomic-embed-text",
      "name": "Nomic Embed Text (Lenovo)",
      "description": "nomic-embed-text v1.5 — 768-dim embeddings, running on Lenovo RTX 8000 GPU.",
      "provider": "nomic",
      "context_length": 8192,
      "upstream_input_usd_per_token": 0,
      "upstream_output_usd_per_token": 0,
      "our_input_usd_per_token": 0,
      "our_output_usd_per_token": 0,
      "markup_multiplier": 1,
      "capabilities_json": "{\"shared_local\":true,\"upstream_id\":\"up_lenovo_rtx8000_ollama\"}",
      "last_synced_at": null,
      "created_at": "2026-05-26 10:21:10"
    },
    {
      "id": "shared-local/up_lenovo_rtx8000_ollama/qwen3:8b",
      "name": "qwen3:8b",
      "description": "Hosted by a UAI user via a shared custom upstream.",
      "provider": "shared-local",
      "context_length": 131072,
      "upstream_input_usd_per_token": 0,
      "upstream_output_usd_per_token": 0,
      "our_input_usd_per_token": 0,
      "our_output_usd_per_token": 0,
      "markup_multiplier": 0,
      "last_synced_at": "2026-05-27 12:15:05",
      "created_at": "2026-05-09 11:00:40",
      "updated_at": "2026-05-27 12:15:05"
    },
    {
      "id": "shared-local/up_lenovo_rtx8000_ollama/qwen3:8b-cpu",
      "name": "qwen3:8b-cpu",
      "description": "Hosted by a UAI user via a shared custom upstream.",
      "provider": "shared-local",
      "context_length": 131072,
      "upstream_input_usd_per_token": 0,
      "upstream_output_usd_per_token": 0,
      "our_input_usd_per_token": 0,
      "our_output_usd_per_token": 0,
      "markup_multiplier": 0,
      "last_synced_at": "2026-05-27 12:15:05",
      "created_at": "2026-05-09 11:00:40",
      "updated_at": "2026-05-27 12:15:05"
    },
    {
      "id": "shared-local/up_lenovo_rtx8000_ollama/qwen3.6:35b-a3b",
      "name": "Qwen3.6 35B A3B (Lenovo)",
      "description": "Qwen3.6 35B A3B MoE model running on dual Quadro RTX 8000 (92 GB total VRAM) on Lenovo server. noThink mode. Fast inference with GPU load balancing across both cards.",
      "provider": "qwen",
      "context_length": 262144,
      "upstream_input_usd_per_token": 0,
      "upstream_output_usd_per_token": 0,
      "our_input_usd_per_token": 0,
      "our_output_usd_per_token": 0,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"shared_local\":true,\"upstream_id\":\"up_lenovo_rtx8000_ollama\"}",
      "last_synced_at": null,
      "created_at": "2026-05-26 10:21:10"
    },
    {
      "id": "shared-local/up_mac_ultra_local_ollama/nomic-embed-text",
      "name": "Nomic Embed Text (Mac Ultra)",
      "description": "Nomic Embed Text 768-dim embeddings on Mac Ultra (M1 Ultra, 64 GB).",
      "provider": "nomic",
      "context_length": 8192,
      "upstream_input_usd_per_token": 0,
      "upstream_output_usd_per_token": 0,
      "our_input_usd_per_token": 0,
      "our_output_usd_per_token": 0,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"shared_local\":true,\"upstream_id\":\"up_mac_ultra_local_ollama\"}",
      "last_synced_at": null,
      "created_at": "2026-05-26 10:51:59"
    },
    {
      "id": "shared-local/up_mac_ultra_local_ollama/qwen3.6:35b-a3b",
      "name": "Qwen3.6 35B A3B (Mac Ultra)",
      "description": "Qwen3.6 35B A3B MoE model on Mac Ultra (M1 Ultra, 64 GB). Fast inference.",
      "provider": "qwen",
      "context_length": 262144,
      "upstream_input_usd_per_token": 0,
      "upstream_output_usd_per_token": 0,
      "our_input_usd_per_token": 0,
      "our_output_usd_per_token": 0,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"shared_local\":true,\"upstream_id\":\"up_mac_ultra_local_ollama\"}",
      "last_synced_at": null,
      "created_at": "2026-05-26 10:51:59"
    },
    {
      "id": "tencent/hy-mt2-1.8b",
      "name": "Tencent: Hy-MT2-1.8B",
      "description": "Hy-MT2-1.8B is a compact 1.8B-parameter translation model from Tencent. It supports 33 language pairs and five Chinese dialect and minority-language pairs, with workflows for structured, delimiter-based, contextual, glossary-based, and style-guided...",
      "provider": "tencent",
      "context_length": 8192,
      "upstream_input_usd_per_token": 4.4e-8,
      "upstream_output_usd_per_token": 1.77e-7,
      "our_input_usd_per_token": 5.7199999999999996e-8,
      "our_output_usd_per_token": 2.3010000000000003e-7,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text->text\",\"input_modalities\":[\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":8192,\"max_completion_tokens\":4096,\"is_moderated\":false},\"supported_parameters\":[\"max_completion_tokens\",\"max_tokens\",\"stop\",\"temperature\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-08-20T18:00:54.685Z"
    },
    {
      "id": "tencent/hy-mt2-30b-a3b",
      "name": "Tencent: Hy-MT2-30B-A3B",
      "description": "Hy-MT2-30B-A3B is Tencent's flagship translation model in the Hy-MT2 family. It supports 33 language pairs and five Chinese dialect and minority-language pairs, with workflows for structured, delimiter-based, contextual, glossary-based, and...",
      "provider": "tencent",
      "context_length": 8192,
      "upstream_input_usd_per_token": 7.4e-8,
      "upstream_output_usd_per_token": 2.95e-7,
      "our_input_usd_per_token": 9.62e-8,
      "our_output_usd_per_token": 3.835e-7,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text->text\",\"input_modalities\":[\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":8192,\"max_completion_tokens\":4096,\"is_moderated\":false},\"supported_parameters\":[\"max_completion_tokens\",\"max_tokens\",\"response_format\",\"stop\",\"structured_outputs\",\"temperature\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-08-20T18:00:54.685Z"
    },
    {
      "id": "tencent/hy-mt2-7b",
      "name": "Tencent: Hy-MT2-7B",
      "description": "Hy-MT2-7B is a 7B-parameter translation model from Tencent. It supports 33 language pairs and five Chinese dialect and minority-language pairs, with workflows for structured, delimiter-based, contextual, glossary-based, and style-guided translation.",
      "provider": "tencent",
      "context_length": 8192,
      "upstream_input_usd_per_token": 7.4e-8,
      "upstream_output_usd_per_token": 2.95e-7,
      "our_input_usd_per_token": 9.62e-8,
      "our_output_usd_per_token": 3.835e-7,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text->text\",\"input_modalities\":[\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":8192,\"max_completion_tokens\":4096,\"is_moderated\":false},\"supported_parameters\":[\"max_completion_tokens\",\"max_tokens\",\"response_format\",\"stop\",\"structured_outputs\",\"temperature\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-08-23T00:00:08.387Z"
    },
    {
      "id": "tencent/hy3",
      "name": "Tencent: Hy3",
      "description": "Hy3 is a 295B-parameter Mixture-of-Experts model from Tencent (21B active, 192 experts with top-8 routing) built for reasoning, agentic workflows, and real-world production use. It supports a configurable reasoning effort:...",
      "provider": "tencent",
      "context_length": 262144,
      "upstream_input_usd_per_token": 8.25e-8,
      "upstream_output_usd_per_token": 3.3e-7,
      "our_input_usd_per_token": 1.0725000000000001e-7,
      "our_output_usd_per_token": 4.2900000000000004e-7,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text->text\",\"input_modalities\":[\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":262144,\"max_completion_tokens\":128000,\"is_moderated\":false},\"supported_parameters\":[\"frequency_penalty\",\"include_reasoning\",\"logit_bias\",\"max_completion_tokens\",\"max_tokens\",\"min_p\",\"presence_penalty\",\"reasoning\",\"reasoning_effort\",\"repetition_penalty\",\"response_format\",\"seed\",\"stop\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"top_k\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-07-06T18:01:01.349Z"
    },
    {
      "id": "tencent/hy4-preview",
      "name": "Tencent: Hy4 preview",
      "description": "Tencent: Hy4 preview is a mixture-of-experts model from Tencent, with 49B active parameters out of 770B total. It is designed for coding agents, complex tool-use workflows, and productivity tasks that...",
      "provider": "tencent",
      "context_length": 1048576,
      "upstream_input_usd_per_token": 8.34e-7,
      "upstream_output_usd_per_token": 0.000002501,
      "our_input_usd_per_token": 0.0000010842,
      "our_output_usd_per_token": 0.0000032513,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text->text\",\"input_modalities\":[\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1048576,\"max_completion_tokens\":64000,\"is_moderated\":false},\"supported_parameters\":[\"include_reasoning\",\"max_completion_tokens\",\"max_tokens\",\"reasoning\",\"reasoning_effort\",\"response_format\",\"stop\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-08-28T12:00:43.812Z"
    },
    {
      "id": "thinkingmachines/inkling",
      "name": "Thinking Machines: Inkling",
      "description": "Inkling is an open-weight multimodal mixture-of-experts model from Thinking Machines Lab, with 41B active parameters out of 975B total. It is designed for general-purpose reasoning, coding, agentic and tool-use systems,...",
      "provider": "thinkingmachines",
      "context_length": 1048576,
      "upstream_input_usd_per_token": 0.000001,
      "upstream_output_usd_per_token": 0.00000405,
      "our_input_usd_per_token": 0.0000013,
      "our_output_usd_per_token": 0.000005265,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+audio->text\",\"input_modalities\":[\"text\",\"image\",\"audio\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":524288,\"max_completion_tokens\":471859,\"is_moderated\":false},\"supported_parameters\":[\"frequency_penalty\",\"include_reasoning\",\"logit_bias\",\"max_tokens\",\"min_p\",\"presence_penalty\",\"reasoning\",\"reasoning_effort\",\"repetition_penalty\",\"response_format\",\"seed\",\"stop\",\"temperature\",\"tool_choice\",\"tools\",\"top_k\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-07-18T00:00:56.979Z"
    },
    {
      "id": "thinkingmachines/inkling-small",
      "name": "Thinking Machines: Inkling Small",
      "description": "Inkling Small is an open-weight multimodal mixture-of-experts model from Thinking Machines Lab, with 12B active parameters out of 276B total. It is positioned as the smaller, more efficient member of...",
      "provider": "thinkingmachines",
      "context_length": 1048576,
      "upstream_input_usd_per_token": 4.5e-7,
      "upstream_output_usd_per_token": 0.0000012,
      "our_input_usd_per_token": 5.85e-7,
      "our_output_usd_per_token": 0.0000015599999999999999,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+audio->text\",\"input_modalities\":[\"text\",\"image\",\"audio\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":524288,\"max_completion_tokens\":262144,\"is_moderated\":false},\"supported_parameters\":[\"frequency_penalty\",\"include_reasoning\",\"logit_bias\",\"logprobs\",\"max_tokens\",\"min_p\",\"presence_penalty\",\"reasoning\",\"reasoning_effort\",\"repetition_penalty\",\"seed\",\"stop\",\"temperature\",\"tool_choice\",\"tools\",\"top_k\",\"top_logprobs\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-07-31T18:00:47.095Z"
    },
    {
      "id": "thinkingmachines/inkling-small:batch",
      "name": "Thinking Machines: Inkling Small (batch)",
      "description": "Inkling Small is an open-weight multimodal mixture-of-experts model from Thinking Machines Lab, with 12B active parameters out of 276B total. It is positioned as the smaller, more efficient member of...",
      "provider": "thinkingmachines",
      "context_length": 524288,
      "upstream_input_usd_per_token": 5e-7,
      "upstream_output_usd_per_token": 0.0000012,
      "our_input_usd_per_token": 6.5e-7,
      "our_output_usd_per_token": 0.0000015599999999999999,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+audio->text\",\"input_modalities\":[\"text\",\"image\",\"audio\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":524288,\"max_completion_tokens\":471859,\"is_moderated\":false},\"supported_parameters\":[\"frequency_penalty\",\"include_reasoning\",\"logit_bias\",\"logprobs\",\"max_tokens\",\"min_p\",\"presence_penalty\",\"reasoning\",\"reasoning_effort\",\"repetition_penalty\",\"stop\",\"temperature\",\"tool_choice\",\"tools\",\"top_k\",\"top_logprobs\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-08-29T00:00:43.742Z"
    },
    {
      "id": "thinkingmachines/inkling-small:free",
      "name": "Thinking Machines: Inkling Small (free)",
      "description": "Inkling Small is an open-weight multimodal mixture-of-experts model from Thinking Machines Lab, with 12B active parameters out of 276B total. It is positioned as the smaller, more efficient member of...",
      "provider": "thinkingmachines",
      "context_length": 1048576,
      "upstream_input_usd_per_token": 0,
      "upstream_output_usd_per_token": 0,
      "our_input_usd_per_token": 0,
      "our_output_usd_per_token": 0,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+audio->text\",\"input_modalities\":[\"text\",\"image\",\"audio\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1048576,\"max_completion_tokens\":262144,\"is_moderated\":false},\"supported_parameters\":[\"frequency_penalty\",\"include_reasoning\",\"max_tokens\",\"presence_penalty\",\"reasoning\",\"reasoning_effort\",\"seed\",\"stop\",\"temperature\",\"tools\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-08-22T00:00:08.464Z"
    },
    {
      "id": "thinkingmachines/inkling:batch",
      "name": "Thinking Machines: Inkling (batch)",
      "description": "Inkling is an open-weight multimodal mixture-of-experts model from Thinking Machines Lab, with 41B active parameters out of 975B total. It is designed for general-purpose reasoning, coding, agentic and tool-use systems,...",
      "provider": "thinkingmachines",
      "context_length": 524288,
      "upstream_input_usd_per_token": 0.000001,
      "upstream_output_usd_per_token": 0.00000405,
      "our_input_usd_per_token": 0.0000013,
      "our_output_usd_per_token": 0.000005265,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+audio->text\",\"input_modalities\":[\"text\",\"image\",\"audio\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":524288,\"max_completion_tokens\":471859,\"is_moderated\":false},\"supported_parameters\":[\"frequency_penalty\",\"include_reasoning\",\"logit_bias\",\"max_tokens\",\"min_p\",\"presence_penalty\",\"reasoning\",\"reasoning_effort\",\"repetition_penalty\",\"stop\",\"temperature\",\"tool_choice\",\"tools\",\"top_k\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-08-06T18:00:30.413Z"
    },
    {
      "id": "thinkingmachines/inkling:free",
      "name": "Thinking Machines: Inkling (free)",
      "description": "Inkling is an open-weight multimodal mixture-of-experts model from Thinking Machines Lab, with 41B active parameters out of 975B total. It is designed for general-purpose reasoning, coding, agentic and tool-use systems,...",
      "provider": "thinkingmachines",
      "context_length": 1048576,
      "upstream_input_usd_per_token": 0,
      "upstream_output_usd_per_token": 0,
      "our_input_usd_per_token": 0,
      "our_output_usd_per_token": 0,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+audio->text\",\"input_modalities\":[\"text\",\"image\",\"audio\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1048576,\"max_completion_tokens\":262144,\"is_moderated\":false},\"supported_parameters\":[\"frequency_penalty\",\"include_reasoning\",\"max_tokens\",\"presence_penalty\",\"reasoning\",\"reasoning_effort\",\"seed\",\"stop\",\"temperature\",\"tools\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-08-22T00:00:08.464Z"
    },
    {
      "id": "upstage/solar-pro4",
      "name": "Upstage: Solar Pro 4",
      "description": "Solar Pro 4 is Upstage's cost-efficient large language model, featuring a 524K context window. It is built for long-horizon tasks and agentic workflows, with strong capabilities in office productivity, document-intensive...",
      "provider": "upstage",
      "context_length": 524288,
      "upstream_input_usd_per_token": 9e-8,
      "upstream_output_usd_per_token": 3.6e-7,
      "our_input_usd_per_token": 1.17e-7,
      "our_output_usd_per_token": 4.68e-7,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text->text\",\"input_modalities\":[\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":524288,\"max_completion_tokens\":131072,\"is_moderated\":false},\"supported_parameters\":[\"frequency_penalty\",\"include_reasoning\",\"max_tokens\",\"parallel_tool_calls\",\"presence_penalty\",\"reasoning\",\"response_format\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-08-11T06:00:41.514Z"
    },
    {
      "id": "x-ai/grok-4.5",
      "name": "SpaceXAI: Grok 4.5",
      "description": "Grok 4.5 is a model from SpaceXAI with frontier performance on coding, knowledge work, and STEM.",
      "provider": "x-ai",
      "context_length": 500000,
      "upstream_input_usd_per_token": 0.000002,
      "upstream_output_usd_per_token": 0.000006,
      "our_input_usd_per_token": 0.0000026,
      "our_output_usd_per_token": 0.0000078,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+file->text\",\"input_modalities\":[\"text\",\"image\",\"file\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Grok\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":500000,\"max_completion_tokens\":450000,\"is_moderated\":false},\"supported_parameters\":[\"include_reasoning\",\"logprobs\",\"max_tokens\",\"reasoning\",\"reasoning_effort\",\"response_format\",\"seed\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"top_logprobs\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-07-09T00:00:59.452Z"
    },
    {
      "id": "x-ai/grok-4.6",
      "name": "SpaceXAI: Grok 4.6",
      "description": "Grok 4.6 is SpaceXAI's smartest model with frontier performance on coding, knowledge work, and STEM.",
      "provider": "x-ai",
      "context_length": 500000,
      "upstream_input_usd_per_token": 0.000002,
      "upstream_output_usd_per_token": 0.000006,
      "our_input_usd_per_token": 0.0000026,
      "our_output_usd_per_token": 0.0000078,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+file->text\",\"input_modalities\":[\"text\",\"image\",\"file\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Grok\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":500000,\"max_completion_tokens\":450000,\"is_moderated\":false},\"supported_parameters\":[\"include_reasoning\",\"logprobs\",\"max_tokens\",\"reasoning\",\"reasoning_effort\",\"response_format\",\"seed\",\"stop\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"top_k\",\"top_logprobs\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-08-12T18:00:37.453Z"
    },
    {
      "id": "z-ai/glm-5.2",
      "name": "Z.ai: GLM 5.2",
      "description": "GLM 5.2 is a large-scale reasoning model from Z.ai. It supports text input and output with a 1M-token context window, and is suited for long-horizon agent workflows, project-level software engineering,...",
      "provider": "z-ai",
      "context_length": 1048576,
      "upstream_input_usd_per_token": 6e-7,
      "upstream_output_usd_per_token": 0.000002,
      "our_input_usd_per_token": 7.799999999999999e-7,
      "our_output_usd_per_token": 0.0000026,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text->text\",\"input_modalities\":[\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":202752,\"max_completion_tokens\":182476,\"is_moderated\":false},\"supported_parameters\":[\"frequency_penalty\",\"include_reasoning\",\"logit_bias\",\"logprobs\",\"max_tokens\",\"min_p\",\"parallel_tool_calls\",\"presence_penalty\",\"reasoning\",\"reasoning_effort\",\"repetition_penalty\",\"response_format\",\"seed\",\"stop\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"top_k\",\"top_logprobs\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-06-16T18:00:57.375Z"
    },
    {
      "id": "z-ai/glm-5.2:batch",
      "name": "Z.ai: GLM 5.2 (batch)",
      "description": "GLM 5.2 is a large-scale reasoning model from Z.ai. It supports text input and output with a 1M-token context window, and is suited for long-horizon agent workflows, project-level software engineering,...",
      "provider": "z-ai",
      "context_length": 1048576,
      "upstream_input_usd_per_token": 7e-7,
      "upstream_output_usd_per_token": 0.0000022,
      "our_input_usd_per_token": 9.1e-7,
      "our_output_usd_per_token": 0.00000286,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text->text\",\"input_modalities\":[\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1048576,\"max_completion_tokens\":943718,\"is_moderated\":false},\"supported_parameters\":[\"frequency_penalty\",\"include_reasoning\",\"logit_bias\",\"logprobs\",\"max_tokens\",\"presence_penalty\",\"reasoning\",\"reasoning_effort\",\"repetition_penalty\",\"response_format\",\"stop\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"top_k\",\"top_logprobs\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-08-06T18:00:30.413Z"
    },
    {
      "id": "z-ai/glm-5.3",
      "name": "Z.ai: GLM 5.3",
      "description": "GLM-5.3 is a large-scale reasoning model from Z.ai, built for complex software engineering and long-horizon agent tasks. It supports text input and output with a 1M-token context window, and improves...",
      "provider": "z-ai",
      "context_length": 1310720,
      "upstream_input_usd_per_token": 0.0000014,
      "upstream_output_usd_per_token": 0.0000044,
      "our_input_usd_per_token": 0.00000182,
      "our_output_usd_per_token": 0.00000572,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text->text\",\"input_modalities\":[\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1048576,\"max_completion_tokens\":943718,\"is_moderated\":false},\"supported_parameters\":[\"frequency_penalty\",\"include_reasoning\",\"logit_bias\",\"logprobs\",\"max_tokens\",\"min_p\",\"parallel_tool_calls\",\"presence_penalty\",\"reasoning\",\"reasoning_effort\",\"repetition_penalty\",\"response_format\",\"seed\",\"stop\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"top_k\",\"top_logprobs\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-08-19T00:00:33.965Z"
    },
    {
      "id": "z-ai/glm-5.3-flash",
      "name": "Z.ai: GLM 5.3 Flash",
      "description": "GLM-5.3-Flash is a native multimodal model from Z.ai. It is suited for efficient coding and long-horizon agent tasks. Its hybrid sparse and linear attention architecture maintains accurate long-context behavior while...",
      "provider": "z-ai",
      "context_length": 1310720,
      "upstream_input_usd_per_token": 1.5e-7,
      "upstream_output_usd_per_token": 5e-7,
      "our_input_usd_per_token": 1.9499999999999999e-7,
      "our_output_usd_per_token": 6.5e-7,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+video->text\",\"input_modalities\":[\"text\",\"image\",\"video\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1048576,\"max_completion_tokens\":131072,\"is_moderated\":false},\"supported_parameters\":[\"frequency_penalty\",\"include_reasoning\",\"logit_bias\",\"logprobs\",\"max_tokens\",\"min_p\",\"presence_penalty\",\"reasoning\",\"reasoning_effort\",\"repetition_penalty\",\"response_format\",\"seed\",\"stop\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"top_k\",\"top_logprobs\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-08-26T18:00:43.760Z"
    },
    {
      "id": "z-ai/glm-5.3-flash:batch",
      "name": "Z.ai: GLM 5.3 Flash (batch)",
      "description": "GLM-5.3-Flash is a native multimodal model from Z.ai. It is suited for efficient coding and long-horizon agent tasks. Its hybrid sparse and linear attention architecture maintains accurate long-context behavior while...",
      "provider": "z-ai",
      "context_length": 1048576,
      "upstream_input_usd_per_token": 7.5e-8,
      "upstream_output_usd_per_token": 2.5e-7,
      "our_input_usd_per_token": 9.749999999999999e-8,
      "our_output_usd_per_token": 3.25e-7,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text+image+video->text\",\"input_modalities\":[\"text\",\"image\",\"video\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1048576,\"max_completion_tokens\":943718,\"is_moderated\":false},\"supported_parameters\":[\"frequency_penalty\",\"include_reasoning\",\"logit_bias\",\"logprobs\",\"max_tokens\",\"min_p\",\"presence_penalty\",\"reasoning\",\"reasoning_effort\",\"repetition_penalty\",\"response_format\",\"stop\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"top_k\",\"top_logprobs\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-08-29T00:00:43.742Z"
    },
    {
      "id": "z-ai/glm-5.3:batch",
      "name": "Z.ai: GLM 5.3 (batch)",
      "description": "GLM-5.3 is a large-scale reasoning model from Z.ai, built for complex software engineering and long-horizon agent tasks. It supports text input and output with a 1M-token context window, and improves...",
      "provider": "z-ai",
      "context_length": 1048576,
      "upstream_input_usd_per_token": 7e-7,
      "upstream_output_usd_per_token": 0.0000022,
      "our_input_usd_per_token": 9.1e-7,
      "our_output_usd_per_token": 0.00000286,
      "markup_multiplier": 1.3,
      "capabilities_json": "{\"architecture\":{\"modality\":\"text->text\",\"input_modalities\":[\"text\"],\"output_modalities\":[\"text\"],\"tokenizer\":\"Other\",\"instruct_type\":null},\"modalities\":null,\"top_provider\":{\"context_length\":1048576,\"max_completion_tokens\":943718,\"is_moderated\":false},\"supported_parameters\":[\"frequency_penalty\",\"include_reasoning\",\"logit_bias\",\"logprobs\",\"max_tokens\",\"presence_penalty\",\"reasoning\",\"reasoning_effort\",\"repetition_penalty\",\"response_format\",\"stop\",\"structured_outputs\",\"temperature\",\"tool_choice\",\"tools\",\"top_k\",\"top_logprobs\",\"top_p\"]}",
      "last_synced_at": "2026-09-13T00:00:32.292Z",
      "created_at": "2026-09-08T18:00:24.611Z"
    }
  ],
  "count": 129
}