工具教程

27B大模型装进手机!Bonsai 27B让iPhone也能跑AI,手把手教你本地部署

AI执行官

导语:过去我们用手机跑AI,基本只能跑个几亿参数的小模型,回答个问题还行,稍微复杂点的推理、编程、工具调用就歇菜了。但就在这两天,一家叫PrismML的公司发布了Bonsai 27B——一个270亿参数的大模型,居然能在iPhone上运行。而且不是噱头,是真正能跑、能推理、能看图、能调用工具。

这篇文章就手把手教你,普通人怎么用上这个”能装进口袋的大模型”。

一、Bonsai 27B到底是什么?

PrismML是一家从加州理工学院出来的创业公司,背后有Khosla Ventures、Google、Samsung等投资机构支持。他们一直在做一件事:把大模型压缩到极限,同时尽量保留能力。

这次发布的Bonsai 27B,基于阿里最新的Qwen3.6-27B改造。它有两个版本:

  • 1-bit Bonsai 27B:3.9GB,能在iPhone 17 Pro上运行。
  • Ternary Bonsai 27B:5.9GB,面向笔记本,质量更高。

一个27B模型,原本16位精度要占约54GB,4位量化也要18GB。PrismML用超低比特量化技术,把1-bit版本压到3.9GB,首次让27B级别的模型住进了手机。

能力保留也相当夸张:Ternary版本保留95%全精度能力,1-bit版本保留90%。

二、它能干什么?

别看压缩得狠,Bonsai 27B能干的事不少:

  • 多步推理:解数学题、逻辑分析、复杂问题拆解。
  • 编程辅助:写代码、改bug、解释代码。
  • 工具调用:能调用函数、查询信息、完成多步骤任务。
  • 视觉理解:能看截图、文档、照片,做多模态分析。
  • 长上下文:支持26.2万token上下文,可以一次性读长文档。

官方给出的性能参考:

  • 在RTX 5090上,1-bit版本最高163 token/秒,Ternary版本134 token/秒。
  • 在M5 Max Mac上,1-bit版本最高87 token/秒,Ternary版本58 token/秒。
  • 在iPhone上运行1-bit版本,速度足够日常使用(具体速度取决于任务复杂度)。

三、适合什么人?

这个模型最适合三类人:

  1. 隐私敏感用户:不想把数据发到云端,比如处理合同、病历、私人日记。
  2. 经常出差/网络不稳定的人:飞机、高铁、偏远地区也能用AI。
  3. 喜欢折腾的技术爱好者:想体验本地跑大模型的快感。

如果你只是偶尔问问AI、查查资料,云端AI服务(ChatGPT、Kimi、豆包)其实更方便。Bonsai 27B的核心优势是本地、隐私、零订阅费

四、手把手:在电脑上本地部署Bonsai 27B

以下步骤适合Mac和NVIDIA显卡用户。iPhone版本需要等待第三方App集成,目前官方主要提供权重和开发接口。

第一步:确认你的设备

推荐配置:

  • Mac用户:M系列芯片(M1 Pro及以上),内存16GB以上,Ternary 5.9GB版本体验更好。
  • Windows用户:NVIDIA RTX 3060 12GB及以上,或RTX 4090/5090最佳。
  • iPhone用户:目前iPhone 17 Pro可运行1-bit版本,但需要等待第三方App上架或自己编译。

第二步:安装运行环境

Mac用户(MLX):

  1. 确保系统是macOS Ventura或更新版本。
  2. 安装Python 3.10或更高版本。
  3. 安装MLX和transformers:
    pip install mlx-lm transformers

Windows/NVIDIA用户(CUDA):

  1. 安装Python 3.10+。
  2. 安装PyTorch(CUDA版本):
    pip install torch --index-url https://download.pytorch.org/whl/cu124
  3. 安装transformers和PrismML提供的低比特内核(关注官方GitHub仓库)。

第三步:下载模型权重

模型权重在Hugging Face上,搜索”PrismML Bonsai 27B”即可找到。地址通常是:
https://huggingface.co/PrismML

推荐下载:

  • Mac/笔记本:Ternary Bonsai 27B(5.9GB)
  • 手机或内存紧张:1-bit Bonsai 27B(3.9GB)

下载方式可以用Hugging Face CLI:

pip install huggingface-hub
huggingface-cli download PrismML/bonsai-27b-ternary --local-dir ./bonsai-27b-ternary

第四步:运行模型

如果你用MLX,可以用类似下面的代码:

from mlx_lm import load, generate

model, tokenizer = load("./bonsai-27b-ternary")

prompt = "请用大白话解释什么是量子计算。"
response = generate(model, tokenizer, prompt=prompt, max_tokens=512)
print(response)

如果你更喜欢图形界面,可以等待社区推出类似LM Studio、Ollama的集成版本。Ollama一旦支持,只需要一行命令就能跑。

第五步:尝试多模态功能

Bonsai 27B的视觉塔是4bit精度的,可以处理截图和照片。你可以把一张截图发给模型,让它:

  • 总结网页内容;
  • 把图片里的表格转成Excel;
  • 识别发票信息并分类。

具体代码需要参考官方Cookbook或社区Demo。

五、iPhone上怎么跑?

目前iPhone 17 Pro可以运行1-bit Bonsai 27B,但普通人还需要等第三方App。可能的入口有:

  • 开源社区App:比如PocketLLM、MLC Chat等本地模型App如果接入Bonsai,直接下载即可。
  • 自己编译:需要Xcode和iOS开发基础,适合开发者。
  • 官方Demo:PrismML已经放出iPhone运行Demo,正式App可能在近期发布。

如果你现在就想体验,建议先用电脑版。

六、实际使用技巧

本地模型和云端模型用法略有不同,记住这几点:

  1. 别问太刁钻的问题:1-bit版本保留90%能力,但对最新新闻、非常专业的知识可能不如云端模型。
  2. 把它当成离线助手:处理文档、写邮件、整理笔记、翻译、代码辅助都很合适。
  3. 善用长上下文:26.2万token意味着可以一次性塞进去一本短篇小说或几十页合同让它分析。
  4. 保护隐私:本地模型最大的好处就是数据不联网,适合处理敏感内容。
  5. 结合云端使用:简单任务本地做,复杂任务切到云端,这是未来的主流用法。

七、注意事项

  • 手机发热:在iPhone上跑27B模型,持续使用会有明显发热和耗电,建议短时间任务。
  • 内存占用:3.9GB模型加载后,加上运行缓存,需要手机有足够剩余空间。
  • 量化损失:1-bit版本虽然能用,但数学、编程等硬核任务建议用Ternary版本或云端模型。
  • 生态早期:第三方工具、一键安装包还在完善,普通用户可以先收藏,等成熟再上手。

八、常见问题答疑

Q1:Bonsai 27B是免费的吗?

模型权重是Apache 2.0开源的,可以免费下载和使用。PrismML还提供了限时免费的开发者API,方便你先在云端试用。但自己运行需要硬件,硬件本身是要花钱的。

Q2:我的老电脑能跑吗?

如果你用的是8GB内存的Mac或普通核显Windows本,建议先试试Bonsai 8B或4B版本。Bonsai 27B适合16GB以上内存的Mac,或带独立显卡的Windows电脑。

Q3:1-bit版本会不会太弱智?

别被”1-bit”吓到。官方测试显示,1-bit Bonsai 27B保留了90%的全精度能力。日常对话、写作、翻译、简单代码完全够用。只有高难度数学和复杂编程才建议用Ternary版本或云端模型。

Q4:iPhone上到底什么时候能用?

官方已经演示了iPhone 17 Pro Max上运行1-bit版本。普通用户要用的化,需要等待第三方App接入。可能几周内就会有社区App上架。

Q5:它和Ollama、LM Studio有什么关系?

Ollama和LM Studio是本地模型的”播放器”,Bonsai 27B是”模型文件”。一旦这些播放器支持Bonsai的格式,你就不需要写代码,像用普通App一样就能运行。

九、总结

Bonsai 27B的意义不只是”又一个大模型”,它代表了一个新的方向:把足够强的AI,塞进你已经拥有的设备里。

对普通人来说,这意味着:

  • 隐私问题不再那么难解决;
  • 没网也能用AI处理重要工作;
  • AI的成本和使用门槛会持续降低。

如果你有一台较新的Mac或NVIDIA电脑,现在就可以按照上面的步骤下载试试。如果你只有手机,不妨再等几周,看看有没有社区App推出。无论如何,AI正在变得越来越”贴身”,这是好事。

分享给朋友