用订阅制 AI 编程助手写代码,最扫兴的往往不是模型答错,而是改到一半额度用完。五小时用量窗口一旦触顶就只能干等。修 bug、加小功能、改旧代码这类活儿,为等待付月费并不划算。

XDA 撰稿人 Anurag Singh 用了将近六个月 Claude Code 的 20 美元套餐后退订,转而在 VS Code 里搭了一层本地大模型。他的结论是:体验确实比不上云端旗舰模型,但因为不再有额度顾虑,实际完成的工作反而更多。以下是这套本地方案的搭建过程。
第一步:挑一个自己机器跑得动的模型
本地方案成败的关键,是模型能否和 VS Code 同时舒服地跑起来,而不是挑参数最大的那个。这位撰稿人的设备是 16GB 统一内存的 M5 MacBook Air,他实测过的几个候选如下:
- GPT-OSS 20B:推理与工具调用都强,但独占约 16GB 内存,与开发环境同跑压力过大。
- Codestral 22B:量化更激进更轻量,补全质量不错,但更适合做补全而非项目级智能体。
- DeepSeek Coder V2 Lite:占用约 9GB,是另一个可行选项。
- Qwen2.5 Coder 7B / 14B:7B 明显更快,但改动牵涉多个文件时容易跟丢上下文;14B 的 Q4 量化版约占 9GB,平衡最好,且专门针对代码生成、推理与修复训练,还支持工具调用。
工具调用这一项很重要——它决定了模型能否主动查看文件并执行改动,而不只是丢回一段代码。最终他选定 Qwen2.5 Coder 14B 作为主力。
第二步:把模型跑起来并暴露接口
推理后端用 Docker Model Runner,负责模型的下载、存储与运行。在 Docker Desktop 启用后,把 OpenAI 兼容 API 暴露在 12434 端口,再拉取模型即可。
第三步:在 VS Code 里装 Continue 并接上本地模型
让模型真正成为编辑器的一部分、而不是另开一个聊天窗口,靠的是 Continue 扩展。它提供聊天面板、行内代码编辑、自动补全,以及可搜索项目并修改文件的智能体模式。Continue 既支持云端模型,也能通过 OpenAI 兼容接口连接本地模型。
安装扩展后,在 ~/.continue/config.yaml 中添加本地模型配置:
`yaml
- name: Qwen2.5 Coder 14B
provider: openai
model: ai/qwen2.5-coder:14B
apiBase: http://localhost:12434/engines/v1
apiKey: not-needed
contextLength: 8192
maxTokens: 2048
temperature: 0.1
capabilities:
- tool_use
roles:
- chat
- edit
- apply
`
这段配置会把本地模型设为 Continue 的主力编码模型,它可以查看当前项目、搜索文件、给出并应用修改建议,全程不把代码发往外部接口。
第四步:分工与项目规则
实际使用中不必只用一个模型:14B 负责对话和代码编辑,自动补全可以交给更小的 Qwen2.5 Coder 模型,延迟低得多。此外,把项目专属说明写进 .continue/rules/ 目录,包括项目结构、测试命令,以及不希望模型改动的文件,能显著减少返工。
需要接受的几点妥协
这套方案的打磨程度不如 Claude Code。Qwen2.5 Coder 14B 理解大型项目更慢、出错更多,有时需要更具体的指令,无法给一句含糊的要求就指望它自己走完全程。跑 14B 模型也会挤占内存,响应启动比云端慢,长时间使用机器会发热,因此不建议同时开一堆吃内存的程序。
但对多数开发者而言,日常任务本就用不到那么高的自主性。真正的改变是心态:可以让模型把同一个函数解释三遍,反复重试失败的修改,一口气处理一长串小问题,而不必再盯着额度。
来源:XDA Developers
发表回复