零成本调用 Qwen3.6 无限 Token!保姆级教程(curl 实测)
开发 AI Agent 写到一半,调试了无数次终于跑通,一算 token 消耗……钱包先扛不住了。
这个问题困扰着无数开发者:市面上号称"免费"的 API,要么有每日限额,要么免费版能力残缺,要么企业用户另算价格。真正想白嫖一个顶流模型的稳定 API 调用,难如登天。
最近我发现了一个非常值得一试的福利——讯飞星辰 MaaS 平台直接开放了两款阿里 Qwen 模型的免费调用权益:
- Qwen3.6-35B-A3B
- Qwen3.5-35B-A3B
输入输出统统 0 元/百万 tokens,新老用户均可领取,活动到 2026 年 6 月 30 日截止。
今天这篇文章,我用最直接的方式带你搞定:从注册、领取 Key、配置接口,到用 curl 命令实测 API 调用,一步不落,五分钟跑通。
一、先搞清楚:Qwen3.6-35B-A3B 到底有多能打?
在真正上手之前,先来看看这次免费开放的模型到底是什么水平,值不值得花时间。
MoE 架构:用小算力撬动大能力

Qwen3.6-35B-A3B 是阿里 Qwen 团队于 2026 年 4 月正式开源的混合专家(MoE)模型。从名称就能看出端倪:35B 是总参数量,A3B 代表实际激活参数仅 3B。
它的内部结构是一个 256 个"专家"网络的路由系统,每次处理一个 token 时,路由器只唤醒 8 个路由专家 + 1 个共享专家参与计算。
输入 Token
│
▼
┌──────────────┐
│ 路由器 │ ← 根据输入内容选择专家
└──────┬───────┘
│ 从 256 个专家中选 8+1 个
▼
┌──────────────────────────────────────────────┐
│ Expert-1 Expert-7 Expert-42 Expert-88 … │
└──────────────────────────────────────────────┘
│
▼
输出结果(推理成本 ≈ 3B 参数的小模型)
用人话解释:你享受了 35B 的知识积累,但只花了 3B 的推理成本。这正是平台能"免费不限量"给你调用的底层原因——单次推理成本极低。
实测性能:多项基准打赢大块头
光说架构还不够,来看硬数据:

| 基准测试 | Qwen3.6-35B-A3B | Qwen3.5-35B-A3B | Gemma4-26B-A4B |
|---|---|---|---|
| SWE-bench Verified(智能体编程) | 73.4 | 70.0 | 17.4 |
| SWE-bench Multilingual(多语言编程) | 67.2 | 60.3 | 17.3 |
| Terminal-Bench 2.0(终端任务) | 51.5 | 40.5 | 34.2 |
| NL2Repo(端到端代码仓库生成) | 29.4 | 20.5 | — |
SWE-bench Verified 是目前最权威的 AI 智能体编程基准,73.4 分这个成绩意味着它能在真实的 GitHub Issue 修复任务中达到相当高的成功率。
另外,有社区开发者用 8 年前的 GTX 1060 6GB 显卡 + i3 处理器 + 24GB 内存,在 llama.cpp 框架下以每秒 17 tokens 的速度跑起了 Qwen3.6-35B-A3B。这证明了这个模型对端侧部署极其友好,消费级硬件完全可以运行。
二、手把手领 Key(4 步搞定)
第一步:进入讯飞星辰 MaaS 模型广场
打开平台专属入口,进入模型广场:
https://maas.xfyun.cn/modelSquare?ch=MaaS-jgkol-f3D8i
在模型列表中找到以下两个卡片: - Qwen3.6-35B-A3B(标签:多模态、多语言、128k,限时免费) - Qwen3.5-35B-A3B(同样免费)

点击模型卡片左下方的「API调用」按钮。如果未登录,平台会跳转到登录页,支持微信扫码、手机号、账号密码三种方式。
第二步:创建应用
在 API 调用弹窗中,如果你还没有创建过应用,需要先点击「前往创建应用」。
应用名称随便填,比如 test应用,描述也可以空着,点击确认即可。创建成功后,你会在列表里看到对应的 AppID。
第三步:完成实名认证
系统会提示你完成实名认证(个人认证即可),支持身份证或学生认证等多种方式,审核一般几分钟内通过。收到"恭喜您完成讯飞开放平台实名认证"的消息后,即可继续。
第四步:确认并获取三项关键信息
回到 API 调用窗口,选择刚刚创建的应用,确认计费显示为"0 元/百万 tokens"后,点击确认。
此时,在模型服务详情页的「调用信息」区域,你能看到三项关键凭证,全部复制保存好:
| 字段 | 说明 | 示例格式 |
|---|---|---|
API Base URL |
接口地址(OpenAI 格式兼容) | https://maas-api.cn-huabei-1.xf-yun.com/v2 |
API Key |
调用凭证 | sk-xxxxxxxxxxxxxxxx |
modelId |
模型唯一标识(≠ 模型名称!) | xopqwen36v35b |
⚠️ 注意:
modelId是一个类似xopqwen36v35b的字符串,不是Qwen3.6-35B-A3B这个名称。填错会导致调用失败,一定要完整准确地从后台复制。
三、用 curl 跑通 API(无需任何编程环境)
拿到三项凭证后,最快的验证方式是直接用 curl 命令行调用,任何有终端的系统(macOS、Linux、Windows WSL)都能运行,不需要安装任何编程语言或 SDK。

环境变量设置(推荐)
先把凭证存入环境变量,避免明文暴露:
# 替换为你自己的真实值
export MAAS_API_KEY="sk-你的API密钥"
export MAAS_BASE_URL="https://maas-api.cn-huabei-1.xf-yun.com/v2"
export MAAS_MODEL_ID="你的modelId" # 例如 xopqwen36v35b
测试 1:基础问答
发送一个最简单的对话请求,验证接口是否正常:
curl "$MAAS_BASE_URL/chat/completions" \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $MAAS_API_KEY" \
-d '{
"model": "'"$MAAS_MODEL_ID"'",
"temperature": 0.7,
"max_tokens": 512,
"messages": [
{
"role": "system",
"content": "你是一个专业的AI助手"
},
{
"role": "user",
"content": "用一句话介绍一下 MoE(混合专家)模型架构"
}
]
}'
成功响应示例(已格式化):
{
"id": "chatcmpl-abc123",
"object": "chat.completion",
"created": 1749456000,
"model": "xopqwen36v35b",
"choices": [
{
"index": 0,
"message": {
"role": "assistant",
"content": "MoE(混合专家)模型架构通过路由机制在每次推理时只激活部分专家网络,以少量的实际计算开销实现等同于大参数量稠密模型的性能表现。"
},
"finish_reason": "stop"
}
],
"usage": {
"prompt_tokens": 42,
"completion_tokens": 58,
"total_tokens": 100
}
}
响应中最关键的是:
- choices[0].message.content:模型的回答内容
- usage:本次调用消耗的 token 数量(这里是 100 tokens,免费阶段完全不用在意这个数字)
测试 2:代码生成(Qwen3.6 强项)
Qwen3.6 在编程任务上表现尤为出色,来测试一个代码生成任务:
curl "$MAAS_BASE_URL/chat/completions" \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $MAAS_API_KEY" \
-d '{
"model": "'"$MAAS_MODEL_ID"'",
"temperature": 0.3,
"max_tokens": 1024,
"messages": [
{
"role": "system",
"content": "你是一名资深工程师,代码风格简洁规范,必须给出可运行的完整代码"
},
{
"role": "user",
"content": "用 Python 写一个函数,实现归并排序算法,并添加详细注释"
}
]
}'
💡 代码生成场景建议把
temperature设低(0.1~0.3),让模型输出更确定、更规范;创意写作则可以调高到 0.7~1.0。
测试 3:流式输出(Streaming)
大多数 AI 对话产品都使用流式输出,让用户看到逐字生成的效果。只需在请求体中加入 "stream": true:
curl "$MAAS_BASE_URL/chat/completions" \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $MAAS_API_KEY" \
-N \
-d '{
"model": "'"$MAAS_MODEL_ID"'",
"temperature": 0.7,
"max_tokens": 512,
"stream": true,
"messages": [
{
"role": "user",
"content": "简单解释一下什么是向量数据库,以及它在 RAG 系统中的作用"
}
]
}'
流式模式下,服务端会以 Server-Sent Events(SSE) 格式逐块推送数据:
data: {"id":"chatcmpl-xyz","choices":[{"delta":{"role":"assistant","content":"向"},"index":0}]}
data: {"id":"chatcmpl-xyz","choices":[{"delta":{"content":"量"},"index":0}]}
data: {"id":"chatcmpl-xyz","choices":[{"delta":{"content":"数"},"index":0}]}
...
data: [DONE]
每一行 data: 后面是一个 JSON 对象,choices[0].delta.content 包含本次推送的增量文字。最后一行 data: [DONE] 表示生成结束。-N 参数告诉 curl 禁用缓冲,确保输出实时显示。
测试 4:多轮对话
多轮对话的实现方式很直接——把历史消息追加到 messages 数组里:
curl "$MAAS_BASE_URL/chat/completions" \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $MAAS_API_KEY" \
-d '{
"model": "'"$MAAS_MODEL_ID"'",
"temperature": 0.7,
"max_tokens": 512,
"messages": [
{
"role": "user",
"content": "Qwen3.6 支持多模态吗?"
},
{
"role": "assistant",
"content": "是的,Qwen3.6 原生支持多模态,能够感知和理解图像输入。"
},
{
"role": "user",
"content": "那它支持视频输入吗?"
}
]
}'
模型在回答第二个问题时,会结合第一轮的上下文来理解"它"指的是 Qwen3.6。
⚠️ 上下文长度注意:Qwen3.6-35B-A3B 原生支持 262,144 tokens 的上下文窗口,通过 YaRN 扩展甚至可达 100 万 tokens。但实际调用时,更长的 messages 历史会消耗更多 prompt_tokens,在免费阶段不用担心费用,但要注意别超过接口本身的 max_tokens 上限。
四、接入常见 AI 工具
接口完全兼容 OpenAI 格式,意味着任何支持"自定义 OpenAI Endpoint"的工具都可以无缝接入,只需替换三个参数:
| 工具 | 配置入口 | 填写内容 |
|---|---|---|
| OpenClaw | 设置 → 自定义大模型 → 添加服务商 | Base URL + API Key + Model ID |
| Cursor | Settings → Models → OpenAI API Key | 填入 API Key,Base URL 改为 MaaS 地址 |
| Continue.dev | config.json → models | "apiBase" 填 MaaS Base URL |
| LangChain / LlamaIndex | ChatOpenAI(openai_api_base=..., openai_api_key=...) |
直接传入环境变量 |
| LobeChat | 设置 → AI 服务商 → 自定义接口 | 三项参数对应填入 |
以 Python openai 库为例,切换到 MaaS 接口只需修改两行:
from openai import OpenAI
client = OpenAI(
api_key="sk-你的API密钥", # 替换为你的 API Key
base_url="https://maas-api.cn-huabei-1.xf-yun.com/v2" # 替换为你的 Base URL
)
response = client.chat.completions.create(
model="你的modelId", # 替换为你的 modelId
messages=[
{"role": "user", "content": "你好,介绍一下自己"}
]
)
print(response.choices[0].message.content)
和调用原生 OpenAI 接口的代码完全一致,只是换了 api_key 和 base_url,其余代码零修改。
五、拿到免费 API 能做什么?
免费、不限量的高质量 API,最适合这几个场景:
RAG 知识库问答
把企业文档、产品手册、技术文档转换成向量后,调用 Qwen3.6 进行语义检索和答案生成。免费 API 让开发阶段的试错成本归零,你可以放心地反复调试 Prompt、切换 Embedding 方案。
AI 编程助手集成
Cursor、Continue.dev、OpenClaw 等工具都支持自定义模型接入。把 Qwen3.6 作为补全模型,SWE-bench Verified 73.4 分的成绩意味着它在真实代码修复任务中的表现与主流商业模型相当。
AI Agent 开发测试
开发多步骤 Agent 时,每次 Debug 都要调用模型数十次,token 消耗很快就能达到几百万。有了免费不限量的 API,你可以专注于 Agent 逻辑本身,而不是纠结每次测试的成本。
结构化数据提取
从 PDF 合同、邮件、报表等非结构化文本中提取关键字段。Qwen3.6 在 NL2Repo(29.4 分,远超上代 20.5 分)等结构化任务上表现突出,非常适合这类信息抽取需求。
六、排坑指南
在实际使用中可能遇到的问题,这里提前列出来:
| 问题 | 原因 | 解决方案 |
|---|---|---|
401 Unauthorized |
API Key 填错或过期 | 回到 MaaS 后台重新复制 Key |
model not found / 404 |
modelId 写错(写成了模型显示名称) | 必须填 modelId,如 xopqwen36v35b,不是 Qwen3.6-35B-A3B |
| 响应超时 | 请求体太大或网络抖动 | 减少 max_tokens,或增加 curl 的 --max-time 参数 |
| 流式输出乱码 | curl 缓冲问题 | 加 -N 参数禁用缓冲 |
| 7 月 1 日后突然扣费 | 免费活动到期 | 活动截止 6 月 30 日,到期后按量付费(记得关注余额) |
⚠️ 安全提醒:不要将 API Key 明文写进代码并提交到 Git 仓库。始终使用环境变量或
.env文件(加入.gitignore)管理凭证。
总结
这次讯飞星辰 MaaS 平台的福利,站在开发者角度来看,价值非常清晰:
- 对个人开发者:低成本开发 Agent,零 token 焦虑,真正的"炼丹自由"
- 对创业团队:先用免费 API 完成原型和 MVP 验证,后期再按需升级方案,风险可控
- 对企业研发团队:降低实验性项目边际成本,提速 AI 应用落地
整个流程用 curl 就能验证,不需要任何编程语言环境。接口完全兼容 OpenAI 格式,现有的 AI 工具和代码基本零改造就能接入。
活动截止时间:2026 年 6 月 30 日。
免费权益包括: - Qwen3.6-35B-A3B 和 Qwen3.5-35B-A3B 调用全免费 - 输入输出均为 0 元/百万 tokens - 新老用户均可领取,不限量调用
先去领 Key,然后把上面的 curl 命令复制进终端跑一遍,五分钟就能感受到这个模型的真实水平。

长按二维码关注 “边学边练”