diff --git a/packages/ai/src/models.generated.ts b/packages/ai/src/models.generated.ts index 711408da..9cf29c6a 100644 --- a/packages/ai/src/models.generated.ts +++ b/packages/ai/src/models.generated.ts @@ -2491,6 +2491,23 @@ export const MODELS = { contextWindow: 1050000, maxTokens: 128000, } satisfies Model<"azure-openai-responses">, + "gpt-5.5": { + id: "gpt-5.5", + name: "GPT-5.5", + api: "azure-openai-responses", + provider: "azure-openai-responses", + baseUrl: "", + reasoning: true, + input: ["text", "image"], + cost: { + input: 5, + output: 30, + cacheRead: 0.5, + cacheWrite: 0, + }, + contextWindow: 1050000, + maxTokens: 130000, + } satisfies Model<"azure-openai-responses">, "o1": { id: "o1", name: "o1", @@ -3894,8 +3911,8 @@ export const MODELS = { contextWindow: 131072, maxTokens: 8192, } satisfies Model<"google-generative-ai">, - "gemma-4-26b-it": { - id: "gemma-4-26b-it", + "gemma-4-26b-a4b-it": { + id: "gemma-4-26b-a4b-it", name: "Gemma 4 26B", api: "google-generative-ai", provider: "google", @@ -6233,6 +6250,23 @@ export const MODELS = { contextWindow: 1050000, maxTokens: 128000, } satisfies Model<"openai-responses">, + "gpt-5.5": { + id: "gpt-5.5", + name: "GPT-5.5", + api: "openai-responses", + provider: "openai", + baseUrl: "https://api.openai.com/v1", + reasoning: true, + input: ["text", "image"], + cost: { + input: 5, + output: 30, + cacheRead: 0.5, + cacheWrite: 0, + }, + contextWindow: 1050000, + maxTokens: 130000, + } satisfies Model<"openai-responses">, "o1": { id: "o1", name: "o1", @@ -7019,6 +7053,23 @@ export const MODELS = { contextWindow: 1050000, maxTokens: 128000, } satisfies Model<"openai-responses">, + "hy3-preview-free": { + id: "hy3-preview-free", + name: "Hy3 preview Free", + api: "openai-completions", + provider: "opencode", + baseUrl: "https://opencode.ai/zen/v1", + reasoning: true, + input: ["text"], + cost: { + input: 0, + output: 0, + cacheRead: 0, + cacheWrite: 0, + }, + contextWindow: 256000, + maxTokens: 64000, + } satisfies Model<"openai-completions">, "kimi-k2.5": { id: "kimi-k2.5", name: "Kimi K2.5", @@ -7771,23 +7822,6 @@ export const MODELS = { contextWindow: 131000, maxTokens: 4096, } satisfies Model<"openai-completions">, - "arcee-ai/trinity-large-preview:free": { - id: "arcee-ai/trinity-large-preview:free", - name: "Arcee AI: Trinity Large Preview (free)", - api: "openai-completions", - provider: "openrouter", - baseUrl: "https://openrouter.ai/api/v1", - reasoning: false, - input: ["text"], - cost: { - input: 0, - output: 0, - cacheRead: 0, - cacheWrite: 0, - }, - contextWindow: 131000, - maxTokens: 4096, - } satisfies Model<"openai-completions">, "arcee-ai/trinity-large-thinking": { id: "arcee-ai/trinity-large-thinking", name: "Arcee AI: Trinity Large Thinking", @@ -8109,7 +8143,7 @@ export const MODELS = { cacheWrite: 0, }, contextWindow: 131072, - maxTokens: 32768, + maxTokens: 65536, } satisfies Model<"openai-completions">, "deepseek/deepseek-v3.2-exp": { id: "deepseek/deepseek-v3.2-exp", @@ -8159,7 +8193,7 @@ export const MODELS = { cacheRead: 0.024999999999999998, cacheWrite: 0.08333333333333334, }, - contextWindow: 1000000, + contextWindow: 1048576, maxTokens: 8192, } satisfies Model<"openai-completions">, "google/gemini-2.0-flash-lite-001": { @@ -8358,13 +8392,13 @@ export const MODELS = { reasoning: true, input: ["text", "image"], cost: { - input: 0.07, - output: 0.35, - cacheRead: 0.04, + input: 0.06, + output: 0.33, + cacheRead: 0, cacheWrite: 0, }, contextWindow: 262144, - maxTokens: 262144, + maxTokens: 4096, } satisfies Model<"openai-completions">, "google/gemma-4-26b-a4b-it:free": { id: "google/gemma-4-26b-a4b-it:free", @@ -8394,7 +8428,7 @@ export const MODELS = { cost: { input: 0.13, output: 0.38, - cacheRead: 0.019999999499999997, + cacheRead: 0, cacheWrite: 0, }, contextWindow: 262144, @@ -8434,6 +8468,23 @@ export const MODELS = { contextWindow: 128000, maxTokens: 50000, } satisfies Model<"openai-completions">, + "inclusionai/ling-2.6-1t:free": { + id: "inclusionai/ling-2.6-1t:free", + name: "inclusionAI: Ling-2.6-1T (free)", + api: "openai-completions", + provider: "openrouter", + baseUrl: "https://openrouter.ai/api/v1", + reasoning: false, + input: ["text"], + cost: { + input: 0, + output: 0, + cacheRead: 0, + cacheWrite: 0, + }, + contextWindow: 262144, + maxTokens: 32768, + } satisfies Model<"openai-completions">, "inclusionai/ling-2.6-flash:free": { id: "inclusionai/ling-2.6-flash:free", name: "inclusionAI: Ling-2.6-flash (free)", @@ -8902,13 +8953,13 @@ export const MODELS = { reasoning: false, input: ["text"], cost: { - input: 0.02, - output: 0.04, + input: 0.01, + output: 0.03, cacheRead: 0, cacheWrite: 0, }, contextWindow: 131072, - maxTokens: 16384, + maxTokens: 4096, } satisfies Model<"openai-completions">, "mistralai/mistral-saba": { id: "mistralai/mistral-saba", @@ -9123,13 +9174,13 @@ export const MODELS = { reasoning: true, input: ["text", "image"], cost: { - input: 0.7999999999999999, - output: 3.5, - cacheRead: 0.19999999999999998, + input: 0.7448, + output: 4.655, + cacheRead: 0.1463, cacheWrite: 0, }, - contextWindow: 262144, - maxTokens: 262144, + contextWindow: 256000, + maxTokens: 65536, } satisfies Model<"openai-completions">, "nex-agi/deepseek-v3.1-nex-n1": { id: "nex-agi/deepseek-v3.1-nex-n1", @@ -10466,13 +10517,13 @@ export const MODELS = { reasoning: true, input: ["text"], cost: { - input: 0.13, - output: 0.6, + input: 0.14950000000000002, + output: 1.495, cacheRead: 0, cacheWrite: 0, }, - contextWindow: 262144, - maxTokens: 262144, + contextWindow: 131072, + maxTokens: 4096, } satisfies Model<"openai-completions">, "qwen/qwen3-30b-a3b": { id: "qwen/qwen3-30b-a3b", @@ -11103,6 +11154,23 @@ export const MODELS = { contextWindow: 262144, maxTokens: 65536, } satisfies Model<"openai-completions">, + "tencent/hy3-preview:free": { + id: "tencent/hy3-preview:free", + name: "Tencent: Hy3 preview (free)", + api: "openai-completions", + provider: "openrouter", + baseUrl: "https://openrouter.ai/api/v1", + reasoning: true, + input: ["text"], + cost: { + input: 0, + output: 0, + cacheRead: 0, + cacheWrite: 0, + }, + contextWindow: 262144, + maxTokens: 262144, + } satisfies Model<"openai-completions">, "thedrummer/rocinante-12b": { id: "thedrummer/rocinante-12b", name: "TheDrummer: Rocinante 12B", @@ -11933,7 +12001,7 @@ export const MODELS = { input: 0.5, output: 3, cacheRead: 0.09999999999999999, - cacheWrite: 0, + cacheWrite: 0.625, }, contextWindow: 1000000, maxTokens: 64000, @@ -14055,9 +14123,9 @@ export const MODELS = { reasoning: true, input: ["text"], cost: { - input: 0.09, - output: 0.29, - cacheRead: 0.045, + input: 0.09999999999999999, + output: 0.3, + cacheRead: 0.01, cacheWrite: 0, }, contextWindow: 262144, @@ -14274,15 +14342,15 @@ export const MODELS = { provider: "vercel-ai-gateway", baseUrl: "https://ai-gateway.vercel.sh", reasoning: true, - input: ["text", "image"], + input: ["text"], cost: { input: 1.4, output: 4.4, cacheRead: 0.26, cacheWrite: 0, }, - contextWindow: 202752, - maxTokens: 202752, + contextWindow: 202800, + maxTokens: 64000, } satisfies Model<"anthropic-messages">, "zai/glm-5v-turbo": { id: "zai/glm-5v-turbo", diff --git a/packages/ai/src/providers/openai-codex-responses.ts b/packages/ai/src/providers/openai-codex-responses.ts index 08a58779..a581748a 100644 --- a/packages/ai/src/providers/openai-codex-responses.ts +++ b/packages/ai/src/providers/openai-codex-responses.ts @@ -356,26 +356,36 @@ function buildRequestBody( function clampReasoningEffort(modelId: string, effort: string): string { const id = modelId.includes("/") ? modelId.split("/").pop()! : modelId; - if ((id.startsWith("gpt-5.2") || id.startsWith("gpt-5.3") || id.startsWith("gpt-5.4")) && effort === "minimal") + if ( + (id.startsWith("gpt-5.2") || id.startsWith("gpt-5.3") || id.startsWith("gpt-5.4") || id.startsWith("gpt-5.5")) && + effort === "minimal" + ) return "low"; if (id === "gpt-5.1" && effort === "xhigh") return "high"; if (id === "gpt-5.1-codex-mini") return effort === "high" || effort === "xhigh" ? "high" : "medium"; return effort; } -function getServiceTierCostMultiplier(serviceTier: ResponseCreateParamsStreaming["service_tier"] | undefined): number { +function getServiceTierCostMultiplier( + model: Pick, "id">, + serviceTier: ResponseCreateParamsStreaming["service_tier"] | undefined, +): number { switch (serviceTier) { case "flex": return 0.5; case "priority": - return 2; + return model.id === "gpt-5.5" ? 2.5 : 2; default: return 1; } } -function applyServiceTierPricing(usage: Usage, serviceTier: ResponseCreateParamsStreaming["service_tier"] | undefined) { - const multiplier = getServiceTierCostMultiplier(serviceTier); +function applyServiceTierPricing( + usage: Usage, + serviceTier: ResponseCreateParamsStreaming["service_tier"] | undefined, + model: Pick, "id">, +) { + const multiplier = getServiceTierCostMultiplier(model, serviceTier); if (multiplier === 1) return; usage.cost.input *= multiplier; @@ -424,7 +434,7 @@ async function processStream( await processResponsesStream(mapCodexEvents(parseSSE(response)), output, stream, model, { serviceTier: options?.serviceTier, resolveServiceTier: resolveCodexServiceTier, - applyServiceTierPricing, + applyServiceTierPricing: (usage, serviceTier) => applyServiceTierPricing(usage, serviceTier, model), }); } @@ -859,7 +869,7 @@ async function processWebSocketStream( await processResponsesStream(mapCodexEvents(parseWebSocket(socket, options?.signal)), output, stream, model, { serviceTier: options?.serviceTier, resolveServiceTier: resolveCodexServiceTier, - applyServiceTierPricing, + applyServiceTierPricing: (usage, serviceTier) => applyServiceTierPricing(usage, serviceTier, model), }); if (options?.signal?.aborted) { keepConnection = false; diff --git a/packages/ai/src/providers/openai-responses.ts b/packages/ai/src/providers/openai-responses.ts index 8048d855..6ce7eada 100644 --- a/packages/ai/src/providers/openai-responses.ts +++ b/packages/ai/src/providers/openai-responses.ts @@ -106,7 +106,7 @@ export const streamOpenAIResponses: StreamFunction<"openai-responses", OpenAIRes await processResponsesStream(openaiStream, output, stream, model, { serviceTier: options?.serviceTier, - applyServiceTierPricing, + applyServiceTierPricing: (usage, serviceTier) => applyServiceTierPricing(usage, serviceTier, model), }); if (options?.signal?.aborted) { @@ -246,19 +246,26 @@ function buildParams(model: Model<"openai-responses">, context: Context, options return params; } -function getServiceTierCostMultiplier(serviceTier: ResponseCreateParamsStreaming["service_tier"] | undefined): number { +function getServiceTierCostMultiplier( + model: Pick, "id">, + serviceTier: ResponseCreateParamsStreaming["service_tier"] | undefined, +): number { switch (serviceTier) { case "flex": return 0.5; case "priority": - return 2; + return model.id === "gpt-5.5" ? 2.5 : 2; default: return 1; } } -function applyServiceTierPricing(usage: Usage, serviceTier: ResponseCreateParamsStreaming["service_tier"] | undefined) { - const multiplier = getServiceTierCostMultiplier(serviceTier); +function applyServiceTierPricing( + usage: Usage, + serviceTier: ResponseCreateParamsStreaming["service_tier"] | undefined, + model: Pick, "id">, +) { + const multiplier = getServiceTierCostMultiplier(model, serviceTier); if (multiplier === 1) return; usage.cost.input *= multiplier; diff --git a/packages/ai/test/openai-codex-stream.test.ts b/packages/ai/test/openai-codex-stream.test.ts index d944d662..34bedb1f 100644 --- a/packages/ai/test/openai-codex-stream.test.ts +++ b/packages/ai/test/openai-codex-stream.test.ts @@ -406,6 +406,7 @@ describe("openai-codex streaming", () => { await streamResult.result(); }); + it.each(["gpt-5.3-codex", "gpt-5.4", "gpt-5.5"])("clamps %s minimal reasoning effort to low", async (modelId) => { it("preserves gpt-5.5 xhigh reasoning effort from simple options", async () => { const tempDir = mkdtempSync(join(tmpdir(), "pi-codex-stream-")); process.env.PI_CODING_AGENT_DIR = tempDir; @@ -558,93 +559,98 @@ describe("openai-codex streaming", () => { }); it.each([ - ["flex", 0.5], - ["priority", 2], - ] as const)("uses the client-sent %s service tier when Codex echoes default", async (serviceTier, multiplier) => { - const tempDir = mkdtempSync(join(tmpdir(), "pi-codex-stream-")); - process.env.PI_CODING_AGENT_DIR = tempDir; - const token = mockToken(); - const sse = `${[ - `data: ${JSON.stringify({ - type: "response.output_item.added", - item: { type: "message", id: "msg_1", role: "assistant", status: "in_progress", content: [] }, - })}`, - `data: ${JSON.stringify({ type: "response.content_part.added", part: { type: "output_text", text: "" } })}`, - `data: ${JSON.stringify({ type: "response.output_text.delta", delta: "Hello" })}`, - `data: ${JSON.stringify({ - type: "response.output_item.done", - item: { - type: "message", - id: "msg_1", - role: "assistant", - status: "completed", - content: [{ type: "output_text", text: "Hello" }], - }, - })}`, - `data: ${JSON.stringify({ - type: "response.completed", - response: { - status: "completed", - service_tier: "default", - usage: { - input_tokens: 1000000, - output_tokens: 1000000, - total_tokens: 2000000, - input_tokens_details: { cached_tokens: 0 }, + ["gpt-5.1-codex", "flex", 0.5], + ["gpt-5.1-codex", "priority", 2], + ["gpt-5.5", "flex", 0.5], + ["gpt-5.5", "priority", 2.5], + ] as const)( + "uses the client-sent %s service tier for %s when Codex echoes default", + async (modelId, serviceTier, multiplier) => { + const tempDir = mkdtempSync(join(tmpdir(), "pi-codex-stream-")); + process.env.PI_CODING_AGENT_DIR = tempDir; + const token = mockToken(); + const sse = `${[ + `data: ${JSON.stringify({ + type: "response.output_item.added", + item: { type: "message", id: "msg_1", role: "assistant", status: "in_progress", content: [] }, + })}`, + `data: ${JSON.stringify({ type: "response.content_part.added", part: { type: "output_text", text: "" } })}`, + `data: ${JSON.stringify({ type: "response.output_text.delta", delta: "Hello" })}`, + `data: ${JSON.stringify({ + type: "response.output_item.done", + item: { + type: "message", + id: "msg_1", + role: "assistant", + status: "completed", + content: [{ type: "output_text", text: "Hello" }], }, + })}`, + `data: ${JSON.stringify({ + type: "response.completed", + response: { + status: "completed", + service_tier: "default", + usage: { + input_tokens: 1000000, + output_tokens: 1000000, + total_tokens: 2000000, + input_tokens_details: { cached_tokens: 0 }, + }, + }, + })}`, + ].join("\n\n")}\n\n`; + + const encoder = new TextEncoder(); + const stream = new ReadableStream({ + start(controller) { + controller.enqueue(encoder.encode(sse)); + controller.close(); }, - })}`, - ].join("\n\n")}\n\n`; + }); - const encoder = new TextEncoder(); - const stream = new ReadableStream({ - start(controller) { - controller.enqueue(encoder.encode(sse)); - controller.close(); - }, - }); + global.fetch = vi.fn(async (input: string | URL) => { + const url = typeof input === "string" ? input : input.toString(); + if (url === "https://api.github.com/repos/openai/codex/releases/latest") { + return new Response(JSON.stringify({ tag_name: "rust-v0.0.0" }), { status: 200 }); + } + if (url.startsWith("https://raw.githubusercontent.com/openai/codex/")) { + return new Response("PROMPT", { status: 200, headers: { etag: '"etag"' } }); + } + if (url === "https://chatgpt.com/backend-api/codex/responses") { + return new Response(stream, { + status: 200, + headers: { "content-type": "text/event-stream" }, + }); + } + return new Response("not found", { status: 404 }); + }) as typeof fetch; - global.fetch = vi.fn(async (input: string | URL) => { - const url = typeof input === "string" ? input : input.toString(); - if (url === "https://api.github.com/repos/openai/codex/releases/latest") { - return new Response(JSON.stringify({ tag_name: "rust-v0.0.0" }), { status: 200 }); - } - if (url.startsWith("https://raw.githubusercontent.com/openai/codex/")) { - return new Response("PROMPT", { status: 200, headers: { etag: '"etag"' } }); - } - if (url === "https://chatgpt.com/backend-api/codex/responses") { - return new Response(stream, { - status: 200, - headers: { "content-type": "text/event-stream" }, - }); - } - return new Response("not found", { status: 404 }); - }) as typeof fetch; + const model: Model<"openai-codex-responses"> = { + id: modelId, + name: modelId === "gpt-5.5" ? "GPT-5.5" : "GPT-5.1 Codex", + api: "openai-codex-responses", + provider: "openai-codex", + baseUrl: "https://chatgpt.com/backend-api", + reasoning: true, + input: ["text"], + cost: { input: 1, output: 2, cacheRead: 0, cacheWrite: 0 }, + contextWindow: 400000, + maxTokens: 128000, + }; - const model: Model<"openai-codex-responses"> = { - id: "gpt-5.1-codex", - name: "GPT-5.1 Codex", - api: "openai-codex-responses", - provider: "openai-codex", - baseUrl: "https://chatgpt.com/backend-api", - reasoning: true, - input: ["text"], - cost: { input: 1, output: 2, cacheRead: 0, cacheWrite: 0 }, - contextWindow: 400000, - maxTokens: 128000, - }; + const context: Context = { + systemPrompt: "You are a helpful assistant.", + messages: [{ role: "user", content: "Say hello", timestamp: Date.now() }], + }; - const context: Context = { - systemPrompt: "You are a helpful assistant.", - messages: [{ role: "user", content: "Say hello", timestamp: Date.now() }], - }; + const result = await streamOpenAICodexResponses(model, context, { apiKey: token, serviceTier }).result(); - const result = await streamOpenAICodexResponses(model, context, { apiKey: token, serviceTier }).result(); - - expect(result.usage.cost.input).toBe(1 * multiplier); - expect(result.usage.cost.output).toBe(2 * multiplier); - expect(result.usage.cost.total).toBe(3 * multiplier); - }); + expect(result.usage.cost.input).toBe(1 * multiplier); + expect(result.usage.cost.output).toBe(2 * multiplier); + expect(result.usage.cost.total).toBe(3 * multiplier); + }, + ); it("does not set session_id/x-client-request-id headers when sessionId is not provided", async () => { const tempDir = mkdtempSync(join(tmpdir(), "pi-codex-stream-")); diff --git a/packages/ai/test/openai-responses-copilot-provider.test.ts b/packages/ai/test/openai-responses-copilot-provider.test.ts index cf25103c..fc1093b7 100644 --- a/packages/ai/test/openai-responses-copilot-provider.test.ts +++ b/packages/ai/test/openai-responses-copilot-provider.test.ts @@ -137,4 +137,49 @@ describe("openai-responses provider defaults", () => { expect(captured).toEqual({ sessionId: null, clientRequestId: null }); }); + + it.each([ + ["gpt-5.4", "priority", 2], + ["gpt-5.5", "priority", 2.5], + ["gpt-5.5", "flex", 0.5], + ] as const)("applies %s %s service-tier cost multiplier", async (modelId, serviceTier, multiplier) => { + const model = getModel("openai", modelId); + const sse = `${[ + `data: ${JSON.stringify({ + type: "response.completed", + response: { + status: "completed", + service_tier: serviceTier, + usage: { + input_tokens: 1000000, + output_tokens: 1000000, + total_tokens: 2000000, + input_tokens_details: { cached_tokens: 0 }, + }, + }, + })}`, + ].join("\n\n")}\n\n`; + + vi.spyOn(globalThis, "fetch").mockResolvedValue( + new Response(sse, { + status: 200, + headers: { "content-type": "text/event-stream" }, + }), + ); + + const stream = streamOpenAIResponses( + model, + { + systemPrompt: "sys", + messages: [{ role: "user", content: "hi", timestamp: Date.now() }], + }, + { apiKey: "test-key", serviceTier }, + ); + + const result = await stream.result(); + + expect(result.usage.cost.input).toBe(model.cost.input * multiplier); + expect(result.usage.cost.output).toBe(model.cost.output * multiplier); + expect(result.usage.cost.total).toBe((model.cost.input + model.cost.output) * multiplier); + }); });