8月14日晚间,阿里千问开源了Qwen3.8-27B模型——一个270亿参数的多模态AI模型,编程能力部分超越Claude Opus 4.6 Max,而且4-bit量化后只要17GB显存就能跑。这意味着,你只需要一张RTX 4090或者一台M4 Max MacBook,就能在本地免费使用接近国际前沿的AI编程助手。
今天这篇文章,我会手把手教你怎么在自己的电脑上把Qwen3.8-27B跑起来。全程零基础友好,跟着步骤走就行。
一、先看看你的电脑能不能跑
Qwen3.8-27B是一个270亿参数的模型,不同精度下对显存/内存的要求不同:
| 精度 | 所需显存/内存 | 适合的设备 |
|---|---|---|
| 4-bit量化 | 约17-19GB | RTX 4090(24GB)/ Mac M4 Pro 32GB+ |
| 6-bit量化 | 约24GB | RTX 5090(32GB)/ 单张24GB显卡 |
| 8-bit量化 | 约31GB | 32GB+显卡 |
| 原始精度BF16 | 约56GB | 80GB级专业卡(H100等) |
简单判断:
- Windows/Linux + NVIDIA显卡:显存≥16GB(如RTX 4090),选4-bit量化版本
- Mac(Apple Silicon):统一内存≥32GB(如M4 Pro/M5 Max),选MLX版本
- 显存不够?:Qwen3.8-27B支持3-bit量化(约13GB),16GB显卡也能尝试
二、方法一:用Ollama一键运行(最简单,推荐新手)
Ollama是本地运行大模型最简单的工具,一条命令就能下载并启动模型。
第1步:安装Ollama
前往 ollama.com 下载对应系统的安装包:
- Mac:下载 .dmg 文件,拖入 Applications 即可
- Windows:下载 .exe 安装程序,一路下一步
- Linux:执行
curl -fsSL https://ollama.com/install.sh | sh
安装完成后,打开终端(Mac/Linux)或命令提示符(Windows),输入以下命令确认安装成功:
ollama --version
第2步:下载并运行Qwen3.8-27B
在终端中执行:
# 标准版(NVIDIA显卡)
ollama run qwen3.8:27b
# Apple Silicon Mac专用MLX版
ollama run qwen3.8:27b-mlx
首次运行会自动下载模型文件(约17GB),根据网速可能需要10-30分钟。下载完成后,你会看到一个对话提示符,直接开始聊天即可。
第3步:开始对话
>>> 帮我写一个Python函数,接收一个列表,返回其中所有偶数的平方
def even_squares(lst):
"""返回列表中所有偶数的平方"""
return [x**2 for x in lst if x % 2 == 0]
# 测试
print(even_squares([1, 2, 3, 4, 5, 6])) # 输出: [4, 16, 36]
Qwen3.8-27B默认开启”思考模式”(Thinking),它会先在内部推理再给出答案。对于简单问题,你可以关闭思考来加速:
>>> /set parameter num_ctx 8192
>>> /set parameter temperature 0.7
三、方法二:用LM Studio图形界面运行(适合不想碰命令行的用户)
LM Studio是一个图形化的本地模型运行工具,界面类似ChatGPT,操作更直观。
第1步:下载LM Studio
前往 lmstudio.ai 下载安装包,支持Mac/Windows/Linux。
第2步:搜索并下载模型
- 打开LM Studio,在顶部搜索栏输入
qwen3.8-27b - 在搜索结果中找到
qwen/qwen3.8-27b或unsloth/Qwen3.8-27B-GGUF - 选择4-bit量化版本(文件名中包含
Q4_K的那个,约17GB) - 点击Download开始下载
第3步:开始聊天
- 下载完成后,点击左侧的Chat图标
- 在顶部模型下拉菜单中选择刚下载的Qwen3.8-27B
- 在输入框中直接输入问题,按回车发送
推荐参数设置(在右侧Settings面板中调整):
- Temperature: 1.0(思考模式)或 0.7(普通对话)
- Top P: 0.95
- Top K: 20
- Context Length: 根据显存设置,建议8192-32768
四、方法三:用Python代码调用(适合开发者)
如果你想在代码中调用Qwen3.8-27B,可以用vLLM或llama.cpp启动一个OpenAI兼容的API服务。
用llama.cpp启动API服务
# 启动API服务(默认端口8080)
./llama-server \
--model unsloth/Qwen3.8-27B-GGUF/Qwen3.8-27B-UD-Q4_K_XL.gguf \
--temp 1.0 --top-p 0.95 --top-k 20 \
--port 8080
用Python调用
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:8080/v1",
api_key="local" # 本地运行不需要真实key
)
response = client.chat.completions.create(
model="Qwen3.8-27B",
messages=[
{"role": "user", "content": "帮我写一个JavaScript倒计时函数"}
],
extra_body={
"chat_template_kwargs": {
"enable_thinking": True,
"preserve_thinking": True
}
},
reasoning_effort="xhigh", # 最高思考深度
stream=True
)
for chunk in response:
if chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="")
五、Qwen3.8-27B擅长什么?
根据官方公布的测试数据,Qwen3.8-27B在以下场景表现出色:
| 场景 | 表现 | 对比 |
|---|---|---|
| 终端编程 | Terminal Bench 2.1得分73.0 | 超Meta Muse Glimmer(51.7) |
| 软件工程 | SWE-bench Pro得分61.7 | 上代53.5,大幅提升 |
| 办公Agent | CoWorkBench得分70.7 | 超Claude Opus 4.6 Max(68.2) |
| 专业工作 | JobBench得分33.4 | 上代21.8,提升约50% |
| 多模态 | OSWorld-Verified得分84.3 | 能看懂截图、图表、文档 |
六、实用小技巧
1. 调节思考深度省时间
Qwen3.8-27B提供三档reasoning_effort:
- low:简单问答用,速度快
- medium:日常编程用,平衡速度和质量
- xhigh(默认):复杂推理和长程任务用,质量最高
注意:降低思考深度未必更省tokens——推理不足可能导致更多失败和重试。
2. 长对话记得清理上下文
Qwen3.8-27B默认开启preserve_thinking(保留思考过程),多轮对话中会保留之前的推理上下文。如果你在做纯问答,可以关闭它以节省上下文窗口:
extra_body={
"chat_template_kwargs": {
"enable_thinking": True,
"preserve_thinking": False # 纯问答时关闭
}
}
3. AMD显卡用户也能跑
AMD已提供Day 0支持,Ryzen AI Max+ 395可达24.5 tokens/秒,Radeon AI PRO R9700可达51.8 tokens/秒。在LM Studio中取消勾选”Try mmap”,并设置正确的MTP值(Ryzen AI Max+设4,Radeon设2)。
总结
Qwen3.8-27B的开源意义在于:你不再需要为使用前沿AI编程能力而支付API费用。一张消费级显卡、一个免费的开源模型,就能获得接近Claude Opus级别的编程辅助能力。无论你是想省API费用的开发者,还是想数据不出本地的企业用户,这个模型都值得一试。
如果你在安装过程中遇到任何问题,欢迎在评论区留言,我会一一解答。
数据来源:智东西、凤凰网科技、aiexpert.news、qwe.edu.pl、AMD官方博客、Unsloth/Hugging Face | 发布时间:2026年8月15日