AI编程额度总不够用?本地模型接进VS Code

用订阅制 AI 编程助手写代码,最扫兴的往往不是模型答错,而是改到一半额度用完。五小时用量窗口一旦触顶就只能干等。修 bug、加小功能、改旧代码这类活儿,为等待付月费并不划算。

XDA 撰稿人 Anurag Singh 用了将近六个月 Claude Code 的 20 美元套餐后退订,转而在 VS Code 里搭了一层本地大模型。他的结论是:体验确实比不上云端旗舰模型,但因为不再有额度顾虑,实际完成的工作反而更多。以下是这套本地方案的搭建过程。

第一步:挑一个自己机器跑得动的模型

本地方案成败的关键,是模型能否和 VS Code 同时舒服地跑起来,而不是挑参数最大的那个。这位撰稿人的设备是 16GB 统一内存的 M5 MacBook Air,他实测过的几个候选如下:

  1. GPT-OSS 20B:推理与工具调用都强,但独占约 16GB 内存,与开发环境同跑压力过大。
  2. Codestral 22B:量化更激进更轻量,补全质量不错,但更适合做补全而非项目级智能体。
  3. DeepSeek Coder V2 Lite:占用约 9GB,是另一个可行选项。
  4. Qwen2.5 Coder 7B / 14B:7B 明显更快,但改动牵涉多个文件时容易跟丢上下文;14B 的 Q4 量化版约占 9GB,平衡最好,且专门针对代码生成、推理与修复训练,还支持工具调用。

工具调用这一项很重要——它决定了模型能否主动查看文件并执行改动,而不只是丢回一段代码。最终他选定 Qwen2.5 Coder 14B 作为主力。

第二步:把模型跑起来并暴露接口

推理后端用 Docker Model Runner,负责模型的下载、存储与运行。在 Docker Desktop 启用后,把 OpenAI 兼容 API 暴露在 12434 端口,再拉取模型即可。

第三步:在 VS Code 里装 Continue 并接上本地模型

让模型真正成为编辑器的一部分、而不是另开一个聊天窗口,靠的是 Continue 扩展。它提供聊天面板、行内代码编辑、自动补全,以及可搜索项目并修改文件的智能体模式。Continue 既支持云端模型,也能通过 OpenAI 兼容接口连接本地模型。

安装扩展后,在 ~/.continue/config.yaml 中添加本地模型配置:

`yaml

  • name: Qwen2.5 Coder 14B

provider: openai

model: ai/qwen2.5-coder:14B

apiBase: http://localhost:12434/engines/v1

apiKey: not-needed

contextLength: 8192

maxTokens: 2048

temperature: 0.1

capabilities:

  • tool_use

roles:

  • chat
  • edit
  • apply

`

这段配置会把本地模型设为 Continue 的主力编码模型,它可以查看当前项目、搜索文件、给出并应用修改建议,全程不把代码发往外部接口。

第四步:分工与项目规则

实际使用中不必只用一个模型:14B 负责对话和代码编辑,自动补全可以交给更小的 Qwen2.5 Coder 模型,延迟低得多。此外,把项目专属说明写进 .continue/rules/ 目录,包括项目结构、测试命令,以及不希望模型改动的文件,能显著减少返工。

需要接受的几点妥协

这套方案的打磨程度不如 Claude Code。Qwen2.5 Coder 14B 理解大型项目更慢、出错更多,有时需要更具体的指令,无法给一句含糊的要求就指望它自己走完全程。跑 14B 模型也会挤占内存,响应启动比云端慢,长时间使用机器会发热,因此不建议同时开一堆吃内存的程序。

但对多数开发者而言,日常任务本就用不到那么高的自主性。真正的改变是心态:可以让模型把同一个函数解释三遍,反复重试失败的修改,一口气处理一长串小问题,而不必再盯着额度。

来源:XDA Developers


发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注