Skip to content
ProductJuly 11, 2026

Apple 设备端 Foundation Model,现已接入 AnyRouter API

在自己的 Mac 上跑 Apple Intelligence 的设备端 Foundation Model,用你平时打其他模型的同一套 AnyRouter API 来调。Prompt 留在本机,token 不花钱,也没有供应商账号要管。

跑在你 Mac 上的模型

Apple 随 Apple Intelligence 附带设备端 Foundation Model——一个完全在本机硬件上跑、数据不离设备的小语言模型。它现在在 AnyRouter 目录里叫 apple/foundation-model,走你已经在用的同一套 OpenAI 兼容 API。

形态和我们托管的其他模型都不同,值得说清楚:AnyRouter 并不替你跑这个模型。是你自己的 Mac 在跑。AnyRouter 只是公共 API 和你机器上模型服务之间的连接。这就是为什么是 $0,也是为什么 prompt 留在你自己的硬件上。

relay 怎么工作

Apple 的模型没有公开端点——它跑在一台没有可供我们调用的服务器地址的机器上。所以不是 AnyRouter 去打供应商,而是你的 Mac 主动连上 AnyRouter。anyr CLI 打开一条出站 WebSocket 并保持连接。当请求打到 apple/foundation-model,AnyRouter 沿这条连接推到你的 Mac,本机模型服务作答,响应沿同一连接流回调用方。

sequenceDiagram
participant C as API caller
participant GW as AnyRouter
participant M as Your Mac (anyr relay)
participant FM as On-device model
M->>GW: open outbound WebSocket, stay connected
C->>GW: POST /v1/chat/completions (apple/foundation-model)
GW->>M: push request down the socket
M->>FM: run on-device
FM-->>M: tokens
M-->>GW: stream response back up
GW-->>C: streamed response
你的 Mac 主动拨出并保持连接;AnyRouter 把每个请求推下去,再把答案流回来。

因为源是你拥有和控制的设备,这是 AnyRouter 里请求不走常规网关路径的唯一地方——公网上根本没有可路由的目标。你 Mac 上的模型服务就是源。

两步配好

你需要一台支持 Apple Intelligence 的 Mac,以及把设备端模型暴露成 OpenAI 兼容端点的本机服务(Apple 的 fm serve,监听 127.0.0.1:1976)。跑起来之后,一条命令接到 AnyRouter 账号:

# 1. Start Apple's on-device model server on your Mac
fm serve

# 2. Connect it to AnyRouter (auto-detects fm serve on port 1976)
anyr relay start

relay start 第一次运行会配对机器——找到已有 AnyRouter API key 就用,否则带你走浏览器登录——然后保持连接,网络掉了自己重连。让它跑着,你的 Mac 就能响应 apple/foundation-model 的请求。

像其他模型一样调用

relay 连上后,apple/foundation-model 和其他目录 id 一样。对它发标准 chat-completions 请求:

curl https://anyrouter.dev/api/v1/chat/completions \
-H "Authorization: Bearer $ANYROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
  "model": "apple/foundation-model",
  "messages": [{ "role": "user", "content": "Summarize this in one sentence." }]
}'

或者在 playground.anyrouter.dev 的模型下拉里选 apple/foundation-model,在浏览器里聊。流式和其他模型一样。请求落地时如果没有在线配对设备,调用会快速失败,好让回退模型接上——不会挂着等一台离线的 Mac。

预期如何

两点要说清楚。第一,设备端模型小,为设备端工作而建——Apple 把上下文窗口封在 4,096 token,系统指令、工具 schema 和对话共享。这是框架硬限制,不是我们能调高的设置。把它当聚焦任务的快速本机模型,不是长上下文主力。

第二,吞吐完全取决于你的 Mac——模型跑在你的硅上,硬件定节奏。我们不会在这里报延迟数字,因为唯一有意义的是你在自己机器上量出来的。

  • 设计上就是私密。Prompt 和补全在你的设备上跑,从不发给第三方模型供应商。
  • 每 token $0。硬件是你提供的,没有可计费项——输入输出都标价为零。
  • 没有供应商账号。不用向 Apple 申请 API key;模型就是 Mac 上 Apple Intelligence 的一部分。

可选:分享闲置容量

如果 Mac 有空闲时间,可以像捐供应商 key 撑共享池那样,让它为其他 AnyRouter 用户服务。连接时加上 --pool:

anyr relay start --pool

池路由只在请求方自己的机器离线时才回退到捐赠设备,并且按设备选择加入——不加这个 flag,你的 Mac 只回答你自己的请求。共享池机制和捐赠者如何拿额度,见 /blog/shared-key-pool。

两分钟发第一笔请求

用自己的 key 免费开始,或充值按 token 计费。Go 每月 $4 额度 — $2/月,或捐一把 provider key 免费开通。

开始使用