教程·阅读约 3 分钟·
1500 token/s 的开源模型 API:Cerebras 上跑通 Qwen 3.8 27B 的实操指南

1500 token/s 的开源模型 API:Cerebras 上跑通 Qwen 3.8 27B 的实操指南

阿里开源模型 Qwen3.8-27B 本周上架 Cerebras,跑出约 1500 token/s 的速度——比本地推理快一两个数量级,输入价格每百万 token 不到 1 美元,免费层每天送 100 万 token。本文用官方文档参数,带你从注册、配 key 到跑通第一个请求,并讲清楚 reasoning 控制、图像输入和速率限制这些坑。

四月·

原创。看完这篇,你能在 15 分钟内用 Cerebras 的免费额度跑通开源模型 Qwen3.8-27B,拿到约 1500 token/s 的推理速度,并避开 reasoning 默认开启、图像输入格式、速率限制这三个最常见的坑。

本地跑 27B 模型,一张消费级显卡通常只能挤出 20-80 token/s;跑 agent 循环时每轮思考动辄几百上千 token,光是等模型"想"就能把人等急。阿里上个月开源 Qwen3.8-27B 后,Cerebras 本周把它挂上了自家推理服务,跑出约 1500 token/s——这个速度不是挤牙膏式的提升,而是把"27B 模型当实时工具用"变成了可能。

这篇教程全部参数来自 Cerebras 官方文档Qwen 3.8 27B 模型页,按步骤走完就能跑通。

Qwen 3.8 27B 是什么

它是阿里 Qwen 开源家族 3.8 代的 27B 稠密(dense)模型,官方定位是 agentic coding、工具调用、研究类长任务。和同代的 2.4T 参数旗舰 Qwen3.8-Max 不同,27B 是社区真正能在各种环境里跑起来的那个档位——权重开源在 Hugging Face 和 ModelScope,支持文本+图像输入、可配置推理深度。发布后在 r/LocalLLaMA 开了 megathread,社区拿它和 Claude Opus 级别的闭源模型做对比测试的帖子一大把。

Cerebras 上它的关键规格:

项目数值
模型 IDqwen-3.8-27b
推理速度约 1500 token/s
上下文窗口免费层 64k,付费 128k
最大输出免费层 32k,付费 40k
输入模态文本 + 图像(base64)
价格输入 $0.99 / 百万 token,输出 $1.49 / 百万 token

注意模型 ID 是 qwen-3.8-27b,写错会直接 404。

—— 广告 ——

为什么是 Cerebras

Cerebras 的卖点是晶圆级引擎(WSE)——整片晶圆做成一块芯片,专为推理设计。它托管的全是开源模型,公开端点当前就两个:Qwen 3.8 27B 和 OpenAI 的 GPT-OSS 120B(约 3000 token/s)。两点对开发者很友好:

  1. API 与 OpenAI 完全兼容——/v1/chat/completions 路径、消息格式、SDK 用法几乎不用改,OpenAI 生态的代码换个 base_url 和 key 就能跑。
  2. 免费试用层够用——每天 100 万 token(Free Trial 档),每分钟 5 个请求、3 万 uncached token,拿来写脚本、跑实验完全够。免费层不要求绑卡。

实操:三步跑通

第一步,拿 API key。 注册 cloud.cerebras.ai,左侧导航进 API Keys 创建一个,然后设置环境变量:

code
export CEREBRAS_API_KEY="your-api-key-here"

macOS/Linux 想持久化就把它加进 ~/.zshrc~/.bashrc;Windows PowerShell 用 $env:CEREBRAS_API_KEY = "..."setx 持久化后要开新终端才生效)。

第二步,装 SDK。 Python 或 Node 二选一:

code
pip install --upgrade cerebras_cloud_sdk
# 或 npm install @cerebras/cerebras_cloud_sdk@latest

不想装 SDK 也行,第三节的 cURL 例子直接能跑。

第三步,发第一个请求。 Python SDK 版:

code
import os
from cerebras.cloud.sdk import Cerebras
 
client = Cerebras(
    api_key=os.environ.get("CEREBRAS_API_KEY"),
)
 
chat_completion = client.chat.completions.create(
    messages=[
        {
            "role": "user",
            "content": "用三句话解释为什么推理速度对 agent 应用重要",
        }
    ],
    model="qwen-3.8-27b",
)
 
print(chat_completion.choices[0].message.content)

cURL 版:

code
curl https://api.cerebras.ai/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer ${CEREBRAS_API_KEY}" \
  -d '{
    "model": "qwen-3.8-27b",
    "messages": [
      {"role": "user", "content": "用三句话解释为什么推理速度对 agent 应用重要"}
    ]
  }'

到这里已经跑通了。接下来是几个不读文档必踩的坑。

三个必踩的坑

坑一:reasoning 默认开启。 Qwen 3.8 27B 的推理模式默认是 high——模型会先"思考"再回答,输出里带思考过程。写代码、跑 agent 时这个默认值未必是你想要的:要快就直接关掉,要深度可以调低档:

code
chat_completion = client.chat.completions.create(
    messages=[{"role": "user", "content": "实现一个 LRU 缓存"}],
    model="qwen-3.8-27b",
    extra_body={"reasoning_effort": "none"},  # 或 low / medium / high
)

坑二:图像输入只收 base64,不收 URL。 模型支持看图,但只支持 Chat Completions 端点、且图片必须是 base64 编码的 PNG/JPEG data URI。外链图片、image detail 控制、图片生成、视频音频都不支持。Completions 端点(非 Chat)更狠——图像、reasoning 控制、结构化消息、工具调用全都不支持,只吐纯文本。

坑三:免费层限速很紧。 Free Trial 档每分钟只有 5 个请求、3 万 uncached token(总量每分钟 9 万)。写个 for 循环批量跑任务,几秒钟就会撞 429。付费的 Developer 档是每分钟 300 请求、15 万 uncached token,不设每日上限。撞了 429 别慌,看下 速率限制文档 怎么提额。

常见报错速查

  • 401 Unauthorized:环境变量没设进当前 shell,先 echo $CEREBRAS_API_KEY 确认。
  • 404 model not found:模型 ID 拼错了(qwen-3.8-27b,注意是 3.8 不是 3.5/3.6)。
  • 429 Too Many Requests:撞限速,免费层最常见,等一分钟或升级档位。

适合干什么,不适合干什么

1500 token/s 的真实价值在高轮次、低延迟敏感的场景:代码补全和重构循环(模型每轮输出几百 token,本地要等十几秒,这里一秒出头)、批量数据清洗和抽取(免费层一天 100 万 token 能处理大量文本)、agent 的快速规划-执行小循环。

不适合的:需要 128k 以上上下文的超长文档任务(它上限就是 128k);必须用外链图片的多模态任务(只收 base64);对输出格式有严格 schema 约束的场景——虽然支持 structured outputs 和 tool calling(strict: true),但 schema 支持范围有讲究,动手前先看官方限制说明。

最后提醒一句:1500 token/s 是服务端的生成速度,端到端延迟还要加上网络往返。从国内直连 api.cerebras.ai 的延迟需要自己实测,追求极致响应的话把它当成"速度很快的远程 API"而不是"本地的模型"来设计架构,心态就对了。

分享到
微博Twitter

© 2026 四月

原文链接:https://www.aprilzz.com/tutorials/cerebras-qwen-38-27b-guide