导语:过去我们用手机跑AI,基本只能跑个几亿参数的小模型,回答个问题还行,稍微复杂点的推理、编程、工具调用就歇菜了。但就在这两天,一家叫PrismML的公司发布了Bonsai 27B——一个270亿参数的大模型,居然能在iPhone上运行。而且不是噱头,是真正能跑、能推理、能看图、能调用工具。
这篇文章就手把手教你,普通人怎么用上这个”能装进口袋的大模型”。
一、Bonsai 27B到底是什么?
PrismML是一家从加州理工学院出来的创业公司,背后有Khosla Ventures、Google、Samsung等投资机构支持。他们一直在做一件事:把大模型压缩到极限,同时尽量保留能力。
这次发布的Bonsai 27B,基于阿里最新的Qwen3.6-27B改造。它有两个版本:
- 1-bit Bonsai 27B:3.9GB,能在iPhone 17 Pro上运行。
- Ternary Bonsai 27B:5.9GB,面向笔记本,质量更高。
一个27B模型,原本16位精度要占约54GB,4位量化也要18GB。PrismML用超低比特量化技术,把1-bit版本压到3.9GB,首次让27B级别的模型住进了手机。
能力保留也相当夸张:Ternary版本保留95%全精度能力,1-bit版本保留90%。
二、它能干什么?
别看压缩得狠,Bonsai 27B能干的事不少:
- 多步推理:解数学题、逻辑分析、复杂问题拆解。
- 编程辅助:写代码、改bug、解释代码。
- 工具调用:能调用函数、查询信息、完成多步骤任务。
- 视觉理解:能看截图、文档、照片,做多模态分析。
- 长上下文:支持26.2万token上下文,可以一次性读长文档。
官方给出的性能参考:
- 在RTX 5090上,1-bit版本最高163 token/秒,Ternary版本134 token/秒。
- 在M5 Max Mac上,1-bit版本最高87 token/秒,Ternary版本58 token/秒。
- 在iPhone上运行1-bit版本,速度足够日常使用(具体速度取决于任务复杂度)。
三、适合什么人?
这个模型最适合三类人:
- 隐私敏感用户:不想把数据发到云端,比如处理合同、病历、私人日记。
- 经常出差/网络不稳定的人:飞机、高铁、偏远地区也能用AI。
- 喜欢折腾的技术爱好者:想体验本地跑大模型的快感。
如果你只是偶尔问问AI、查查资料,云端AI服务(ChatGPT、Kimi、豆包)其实更方便。Bonsai 27B的核心优势是本地、隐私、零订阅费。
四、手把手:在电脑上本地部署Bonsai 27B
以下步骤适合Mac和NVIDIA显卡用户。iPhone版本需要等待第三方App集成,目前官方主要提供权重和开发接口。
第一步:确认你的设备
推荐配置:
- Mac用户:M系列芯片(M1 Pro及以上),内存16GB以上,Ternary 5.9GB版本体验更好。
- Windows用户:NVIDIA RTX 3060 12GB及以上,或RTX 4090/5090最佳。
- iPhone用户:目前iPhone 17 Pro可运行1-bit版本,但需要等待第三方App上架或自己编译。
第二步:安装运行环境
Mac用户(MLX):
- 确保系统是macOS Ventura或更新版本。
- 安装Python 3.10或更高版本。
- 安装MLX和transformers:
pip install mlx-lm transformers
Windows/NVIDIA用户(CUDA):
- 安装Python 3.10+。
- 安装PyTorch(CUDA版本):
pip install torch --index-url https://download.pytorch.org/whl/cu124 - 安装transformers和PrismML提供的低比特内核(关注官方GitHub仓库)。
第三步:下载模型权重
模型权重在Hugging Face上,搜索”PrismML Bonsai 27B”即可找到。地址通常是:https://huggingface.co/PrismML
推荐下载:
- Mac/笔记本:Ternary Bonsai 27B(5.9GB)
- 手机或内存紧张:1-bit Bonsai 27B(3.9GB)
下载方式可以用Hugging Face CLI:
pip install huggingface-hub
huggingface-cli download PrismML/bonsai-27b-ternary --local-dir ./bonsai-27b-ternary
第四步:运行模型
如果你用MLX,可以用类似下面的代码:
from mlx_lm import load, generate
model, tokenizer = load("./bonsai-27b-ternary")
prompt = "请用大白话解释什么是量子计算。"
response = generate(model, tokenizer, prompt=prompt, max_tokens=512)
print(response)
如果你更喜欢图形界面,可以等待社区推出类似LM Studio、Ollama的集成版本。Ollama一旦支持,只需要一行命令就能跑。
第五步:尝试多模态功能
Bonsai 27B的视觉塔是4bit精度的,可以处理截图和照片。你可以把一张截图发给模型,让它:
- 总结网页内容;
- 把图片里的表格转成Excel;
- 识别发票信息并分类。
具体代码需要参考官方Cookbook或社区Demo。
五、iPhone上怎么跑?
目前iPhone 17 Pro可以运行1-bit Bonsai 27B,但普通人还需要等第三方App。可能的入口有:
- 开源社区App:比如PocketLLM、MLC Chat等本地模型App如果接入Bonsai,直接下载即可。
- 自己编译:需要Xcode和iOS开发基础,适合开发者。
- 官方Demo:PrismML已经放出iPhone运行Demo,正式App可能在近期发布。
如果你现在就想体验,建议先用电脑版。
六、实际使用技巧
本地模型和云端模型用法略有不同,记住这几点:
- 别问太刁钻的问题:1-bit版本保留90%能力,但对最新新闻、非常专业的知识可能不如云端模型。
- 把它当成离线助手:处理文档、写邮件、整理笔记、翻译、代码辅助都很合适。
- 善用长上下文:26.2万token意味着可以一次性塞进去一本短篇小说或几十页合同让它分析。
- 保护隐私:本地模型最大的好处就是数据不联网,适合处理敏感内容。
- 结合云端使用:简单任务本地做,复杂任务切到云端,这是未来的主流用法。
七、注意事项
- 手机发热:在iPhone上跑27B模型,持续使用会有明显发热和耗电,建议短时间任务。
- 内存占用:3.9GB模型加载后,加上运行缓存,需要手机有足够剩余空间。
- 量化损失:1-bit版本虽然能用,但数学、编程等硬核任务建议用Ternary版本或云端模型。
- 生态早期:第三方工具、一键安装包还在完善,普通用户可以先收藏,等成熟再上手。
八、常见问题答疑
Q1:Bonsai 27B是免费的吗?
模型权重是Apache 2.0开源的,可以免费下载和使用。PrismML还提供了限时免费的开发者API,方便你先在云端试用。但自己运行需要硬件,硬件本身是要花钱的。
Q2:我的老电脑能跑吗?
如果你用的是8GB内存的Mac或普通核显Windows本,建议先试试Bonsai 8B或4B版本。Bonsai 27B适合16GB以上内存的Mac,或带独立显卡的Windows电脑。
Q3:1-bit版本会不会太弱智?
别被”1-bit”吓到。官方测试显示,1-bit Bonsai 27B保留了90%的全精度能力。日常对话、写作、翻译、简单代码完全够用。只有高难度数学和复杂编程才建议用Ternary版本或云端模型。
Q4:iPhone上到底什么时候能用?
官方已经演示了iPhone 17 Pro Max上运行1-bit版本。普通用户要用的化,需要等待第三方App接入。可能几周内就会有社区App上架。
Q5:它和Ollama、LM Studio有什么关系?
Ollama和LM Studio是本地模型的”播放器”,Bonsai 27B是”模型文件”。一旦这些播放器支持Bonsai的格式,你就不需要写代码,像用普通App一样就能运行。
九、总结
Bonsai 27B的意义不只是”又一个大模型”,它代表了一个新的方向:把足够强的AI,塞进你已经拥有的设备里。
对普通人来说,这意味着:
- 隐私问题不再那么难解决;
- 没网也能用AI处理重要工作;
- AI的成本和使用门槛会持续降低。
如果你有一台较新的Mac或NVIDIA电脑,现在就可以按照上面的步骤下载试试。如果你只有手机,不妨再等几周,看看有没有社区App推出。无论如何,AI正在变得越来越”贴身”,这是好事。