2026 年 9 月 · 前沿模型进入"自主执行"阶段

从认知到落地:AGI
与你的本地免费 AI

0GPT-6 Astra 训练所用 GPU 规模
0Grok 4.7 参数规模
0消费级显卡可跑的 27B 模型体积
0本教程全套方案的软件成本
实时演算:神经网络信息流动示意
01 / 认知

AGI 是什么?先把三个词分清楚

AGI(Artificial General Intelligence,通用人工智能)指的是:一个模型不经过专门训练,就能像人一样跨领域理解、推理、学习并解决新问题的能力。 它和我们今天用的 AI 最大的差别不是"更聪明",而是"不用为每个任务单独做一套系统"。

🔧 ANI · 狭义 AI

只能在单一任务上表现出色:人脸识别、语音转写、推荐算法、翻译。今天的绝大多数 AI 都属于这一类,换个任务就失效。

专才 已大规模商用

🧠 AGI · 通用 AI

能跨领域迁移:会用你教它的方法去处理它从没见过的新问题,能自己规划多步骤任务、使用工具、从反馈中自我修正。

通才 2026 年正在逼近

🚀 ASI · 超级 AI

在几乎所有认知维度上远超人类最顶尖的专家,并且能自我改进。目前属于理论阶段,也是全球治理讨论的焦点。

理论 监管焦点

能力光谱:ANI → AGI → ASI

注意滑块在"通用"区间的停留时间最长——这正是 2024 年以来行业所在的位置:单一任务的冠军很多,跨任务的通才刚刚出现

🧠
ANI单任务专家
已普及
AGI跨任务通才
进行中
ASI全面超越人类
理论阶段

判断"通用"的四个硬指标

跨领域泛化:没训练过的任务也能做关键
自主规划:把大目标拆成可执行步骤关键
工具使用:会调用外部系统补足自身短板已成熟
持续学习:边用边学,不重训也变强进行中

📌 一个具体的对照例子

ANI 时代(2022 年前)
你要做一个"合同审查系统",需要:收集标注数据 → 训练专用模型 → 上线 → 合同类型一变就重新训练。

AGI 思路(2024 年后)
直接把合同丢给通用模型,用自然语言说明规则,它自己读、自己找风险点、自己生成修改建议,你以为它不会的新格式,它也能举一反三。

这就是"通用"的实际含义:同一套能力,处理你事前无法穷举的任务
02 / 能力边界

AGI 能干什么?八个已经真实发生的能力

下面每一条都不是畅想,而是 2025—2026 年已经出现的能力形态。点击卡片查看"它到底做了什么"。

💻 写代码 / 改代码

需求 → 代码 → 自测 → 修复,闭环完成。

📚 超长文档理解

百万级上下文,跨文档检索与比对。

🌏 多语言创作

翻译、改写、润色、风格迁移。

🎧 多模态实时交互

图像 / 语音 / 视频 / 文本统一处理。

🤖 自主完成多步任务

给目标,不给步骤,自己拆解执行。

🔬 科研与数据分析

从数据中生成假设、验证、给结论。

🎨 内容生成

图、视频、音乐、3D,文字直出。

🖱️ 操作电脑干活

替你点鼠标、填表格、整理资料。

👆 点击上方任意卡片,看这条能力的真实边界

(这里会显示该能力的实际表现、能达到什么程度、以及目前还做不到什么。)

03 / 趋势

AGI 发展的趋势:从"会说"到"会做"

把 2017 年以来的关键节点连起来看,主线非常清晰:模型规模持续放大 → 能力从单模态走向多模态 → 交互从对话走向自主执行 → 部署从云端走向端侧与本地

2017

Transformer 诞生

"注意力机制"论文发表,奠定了此后所有大模型的基础架构。

2020 — 2022

规模就是能力

GPT-3 证明"参数 + 数据 + 算力同步放大,能力可预测提升";ChatGPT 让普通人第一次用上大模型。

2023 — 2024

多模态 + 开源追平

模型开始同时理解图文音视频;开源模型与闭源旗舰的差距从"代差"缩小到"几个月"。

2025 — 2026

智能体元年:从对话到执行

工具调用、长任务规划、电脑操作成为主线。开源侧,2026 年 9 月阶跃星辰开源旗舰基座跻身全球开源榜前三,阿里开源图像模型与国产 GPU 实现"发布即适配"。

2026 年 9 月 · 当下

自主执行 + 算力天花板争论

新一代旗舰模型明确以"具备自主执行能力"为定位,训练动用超 10 万块 GPU;同时业内开始公开讨论"要不要踩刹车"——瓶颈已从芯片蔓延到电力。

📈 趋势一:Scaling Law 还没撞墙,但成本开始说话

参数、数据、算力同步放大,性能仍按可预测的幂律提升,前沿训练已进入"十万卡"量级。但同期也出现了公开的"减速"争论:一方面有人呼吁为前沿研发踩刹车,另一方面新的瓶颈已经从芯片转移到电力与能源——2026 年 9 月,英伟达、谷歌等联合成立了 AI 能源管理联盟,推动数据中心按电网状况动态用电。

🏠 趋势二:能力向端侧与本地迁移(对普通人最重要)

27B 级模型量化后只要 17GB 显存,纯 CPU 也能跑到"比人阅读速度快"的输出速度。这意味着:离线、免费、数据不出门的 AI 已经从极客玩具变成日常可用工具——本页后半部分就是完整落地教程。

一句话:云端负责"最强",本地负责"最稳、最私密、零成本"。

🔗 趋势三:从"一个模型"到"模型 + 工具 + 记忆"

单一模型的智力提升正在放缓,实际系统的能力提升越来越多来自智能体工程:任务分解、工具调用(搜索、代码执行、数据库)、记忆与反思、多智能体协作。2026 年的产业共识是:模型是发动机,智能体才是车。

04 / 应用

AGI 在生活中的用途:六个已经落地的场景

下面每个场景都配了 2026 年真实发生的案例。切换标签即可查看(页面也会自动轮播)。

病灶 96% 正常 146 种病症一次识别 影像 → 标注 → 报告

医疗影像:一次扫描,多病种筛查

过去一张片子要一位医生逐个病灶看;现在通用模型可以直接输出"看到什么、位置在哪、可能性多大",医生做最终判断,效率提升数倍。

在基层医院和体检场景,这类能力相当于把三甲医院的阅片经验复制到每一个乡镇卫生院。

真实案例:2026 年 9 月,阿里达摩院通用医疗影像模型 DAMO RADAR 登上《Science》正刊,可一次性识别 146 种病症。
👩‍🎓 Σ abc 已掌握 78% 薄弱点:函数 今日:3 道专项题

教育:真正的"因材施教"变得可复制

模型不只是回答题目,而是判断你为什么错:是概念没建立、还是计算习惯问题,然后给出针对性练习。

对老师而言,批改、出题、学情分析这些重复劳动被接管,备课时间可以真正用在设计教学内容上。

关键变化:从"搜题给答案"升级为"诊断 + 规划学习路径",这是通用能力(跨学科、理解上下文)带来的直接结果。
会议纪要 周报数据 智能体 读取·汇总·核对 自动成稿

办公协作:从"帮我写"到"替我做"

智能体可以跨系统取数:读会议纪要、连表格、生成周报、发到群里,中间不需要你复制粘贴。它改变的是流程,不只是文字。

这也是 2026 年企业侧增长最快的方向——编程、网络安全、客服等场景的订单验证了它的降本效果。

真实案例:飞书 8.0 引入团队智能体"豆包工作伙伴";火山引擎发布"豆包座舱助手"并已与上汽集团达成合作。
行人 0.3s 车道保持 ✓

出行:感知、预测、决策一体的驾驶系统

智能驾驶本质是"多模态 + 实时决策"的 AGI 应用:看懂画面、预测他车意图、在毫秒级给出动作。大模型让长尾场景(施工、异形障碍物)的处理能力明显提升。

真实案例:2026 年 9 月,Lucid 与 Bolt 宣布在欧洲布局 2.5 万辆 Robotaxi;国内多家车企与云厂商签署大模型上车合作;行业预计 2028 年高阶智驾在 A 级及以上乘用车的渗透率将超 50%。
文字 → 图 / 视频 / 音乐

内容创作:一个人的"制作班底"

写脚本、出分镜、生成画面、配音配乐、剪辑成片,过去需要一个团队配合,现在一个创作者可以用自然语言串起来。

2026 年的明显变化是实时性:视频流可以边生成边编辑,数字角色可以实时对话,不再需要"生成—等待—再生成"。

真实案例:生数科技发布 Vidu S2,实现视频流实时编辑与数字角色实时交互;图像生成模型的延迟比上一代最多降低 50%。
本地模型运行中 数据不出本机 · 无需联网 🔒 免费 离线

个人本地助理:不花钱、不联网、不泄密

把模型装在自己电脑上,写周报、改合同、整理资料、做翻译——不按 token 计费、没有使用次数限制、断网也能用,敏感资料永远不会离开你的硬盘。

这就是本页后半部分要教你的东西:从装软件到跑起来,全流程免费。往下翻到 「本地免费部署」

门槛参考:8GB 显存可流畅跑 7B–9B 模型;16GB 可跑 14B;24GB 可跑 27B–35B;没有独显也能纯 CPU 跑小模型。
去看部署教程 →
05 / 原理

AGI 的工作原理:一句话说完,就是一串"猜下一个词"

别看参数上千亿,运转逻辑只有六个步骤,而且循环往复。观看下面这条流水线(点击任意环节可看细节)。

📝
1. 输入文本
✂️
2. 切成词块
🔢
3. 转成向量
🧠
4. 逐层推理
🎯
5. 概率预测
🔁
6. 输出并回喂
1. 输入文本

你输入的每个字对模型来说都不是"意思",而是待处理的符号序列。模型没有记忆中的"字典答案",它做的第一件事是把你的问题切成它认识的单位。

👁️ 核心机制:注意力(Attention)

处理每个词时,模型会去"看"句子里的其他词,判断谁和谁关系大。下面这句话,模型理解"它"指的是"石头",靠的就是注意力权重。

小明石头扔进 湖里因为水面 溅起了水花

网格 = 注意力权重矩阵:越亮的格子表示两个词之间的关联越强。

📊 输出本质:从概率里"取一个"

以"今天天气真"为输入,模型算出的不是一个确定答案,而是所有可能的下一个词的分数:

62%
18%
不错9%
一般6%
其他 200+ 词5%
为什么要懂这一点:你就能理解幻觉从哪来——它天生在"选最像的",不是在"查真的"。所以重要的答案一定要自己核对。
06 / 思维

它怎么"想":五个与你直觉不同的思维特征

把模型当"人"去猜它的思路,几乎一定会猜错。理解下面五条,你就会用得好很多。

🧩 ① 不是查资料,是凭"手感"续写

它没有数据库可查,而是在海量文本里学到了"什么样的上下文后面通常接什么"。所以它答得流畅,但流畅 ≠ 正确。

用法:要事实性答案,就让它"先列依据再下结论",并自己抽查关键数字。

🪜 ② 让它"想出来",比让它"答出来"准得多

直接问答案,它容易顺着最顺口的方向编;让它一步步推导(思维链),正确率会明显提升——因为每一步都是新的"上下文",后面的判断能看到前面的过程。

用法:在提示词里加一句"请分步骤分析,最后再给结论"。

🪟 ③ 记忆 = 当前窗口,不是永久档案

它"记得"的只是这次对话窗口里的内容,窗口一关就归零。所谓"它认识我",要么是它读了你给的资料,要么是外部系统把资料重新喂给了它。

用法:重要背景一次性写清楚;长对话里主动重述关键约束。

🎲 ④ 有随机性,同一个问题会有不同答案

这是"温度"参数在起作用:写文案时你要它发散,做数据核对时你要它收敛。

用法:要稳定输出就降低随机性;要创意就提高;要精确,加"只输出结果,不要解释"。

🔍 ⑤ 是"归纳高手",不是"逻辑机器"

它极擅长从大量例子中找到共同模式,然后把模式套到新情况上;但它不天然遵守严格的形式逻辑,容易被"看起来很合理"的表述带偏(比如顺着你的错误前提往下编)。

关键提醒:当你带着错误前提提问,它常常会礼貌地配合你。提问时别诱导,把条件按事实陈述清楚。

现场演示:同一个问题,两种问法的差别

点击按钮,看模型(示意)如何从"直接下结论"切换到"分步推理"。

某商品原价 200 元,先涨价 20%,再打八折,最终价格是多少?
1第一步:涨价 20% 后价格 = 200 × 1.2 = 240 元
2第二步:打八折 = 240 × 0.8 = 192 元
3第三步:核对——涨 20% 再降 20% 不等于原价,因为基数变了
结论:最终价格 192 元,比原价低 8 元

若直接问"涨 20% 再打八折是多少",很多模型会脱口而出"还是 200"——跳步是出错的头号原因。

07 / 执行

执行任务的逻辑:Agent 主循环

从"你问我答"到"你给目标我干活",中间靠的是一个不断重复的闭环。下面的循环会自动演示,右侧是它处理一个真实任务的完整过程。

Agent
主循环
🎯目标
🗺️规划
🔧调用工具
👀观察结果
🤔反思修正
示例任务:"调研本地部署方案,并写成一页对比表"
1
接收目标(Goal)

不是收到一条条指令,而是收到一句目标 + 约束(要免费、要能离线、要有对比表)。

2
规划与拆解(Plan)

把目标拆成可执行步骤:列出待选工具 → 查各自要求 → 查模型体积 → 归纳对比维度。

3
调用工具(Act)

真的去执行:联网搜索、读文档、跑命令查显存、写文件。工具是它补足自身短板的手。

4
观察结果(Observe)

看返回了什么:搜索有结果吗、命令报错吗、数据缺哪一项。

5
反思修正(Reflect)

发现缺项就改计划重跑;发现假设错了就换路径。这一环是 Agent 与普通问答的分水岭。

6
交付并复核(Deliver)

输出对比表,并自检是否满足全部约束;不符合就回到第 2 步。

🛠️ 它靠什么"动手"

搜索、代码执行、文件读写、数据库查询、调用第三方 API。2026 年这些能力已经标准化:工具调用(Tool Calling) 成为模型基础能力,还有 MCP 这类统一协议让不同工具即插即用。

👥 从单体到多智能体

复杂任务会拆给多个专职智能体:一个查资料、一个写、一个审。真实案例:2026 年 9 月,约一万个 AI 智能体协作约 88 小时,给出了纳维–斯托克斯方程难题的解答,并附上形式化验证代码。

⚠️ 必须知道的三个风险

权限风险:能操作文件/系统的智能体,一定要限定目录与操作范围。
跑偏风险:目标表述含糊时,它会"很努力地做错事"。
成本风险:循环次数失控会烧掉大量额度——本地部署的好处之一就是没有 token 账单。

08 / 平台

AGI 免费平台:三条路线,成本都是 0 元

先用一张表把路线分清:要隐私和无限量 → 本地跑;要最强大模型 → 用平台免费额度;只想试试 → 网页直接用。本页主推第一条,因为它真正"免费且不受限"。

💻 路线一:本地运行(推荐)

把模型下载到自己电脑。软件全部开源免费,没有次数限制、不用注册、断网可用、数据不出本机。唯一成本是电费和硬盘空间。

永久免费 隐私最强 需下载模型

☁️ 路线二:免费 API 额度

注册国内平台领免费 token,调用云端最强模型。有额度上限、需要联网、数据要出本机。适合和本地方案搭配:日常用本地,攻坚用云端。

有额度限制 需实名 模型最强

🌐 路线三:网页直接对话

打开网站就能用,零安装。适合验证"这个模型能不能干我的活",但不可自动化、不可集成到你的软件里

零门槛 不可编程调用

8.1 本地运行工具(全部免费开源)

工具形式免费情况适合谁一句话说明
Ollama命令行 + 后台服务开源免费(MIT)开发者、要自动化/接入软件一条命令跑模型,自带 OpenAI 兼容 API,生态最广
LM Studio图形界面桌面软件个人使用免费新手、不想碰命令行像装个聊天软件一样,内置模型商店,一键下载加载
Open WebUI网页界面(浏览器打开)开源免费想要 ChatGPT 式界面给本地模型套一个网页壳,支持多用户、文档问答
llama.cpp底层推理引擎开源免费要极致控制/嵌入式纯 C++ 实现,CPU 推理的鼻祖,上面两个工具都基于它
vLLM服务器框架开源免费多人在线、高并发吞吐量极高,适合部署给团队用;单机自用没必要

8.2 免费 API 平台(额度会变动,以官网为准)

平台免费额度(参考)特点适合场景
智谱 AIGLM-4-Flash 系列永久免费 + 新用户赠送 token中文写作强,并发较高中文文案、日常问答
硅基流动注册赠送 token + 部分模型永久免费模型种类国内最多(100+)想横向比不同开源模型
ModelScope 魔搭每日约 2000 次请求(跨模型总量)需绑定账号实名,Qwen 系列齐国内下载模型 + 调 API
阿里云百炼新用户大额 token 赠送 + 每模型试用模型覆盖广,企业常用做原型、做应用
火山引擎(豆包)每日赠送 token,按天重置并发高,适合批量高并发测试
DeepSeek 开放平台注册赠送 token代码/推理性价比高写代码、复杂推理
百度千帆 / 讯飞星火部分轻量模型永久免费合规场景友好国内合规要求高的项目
Google AI Studio / Groq / Cerebras每日免费请求额度(国外,需可访问网络)Groq、Cerebras 速度极快追求响应速度的测试
OpenRouter每日免费模型调用次数(聚合平台)一个 Key 调 50+ 模型多渠道对比
提醒:各平台免费政策随时调整(此前已出现免费额度收紧的先例)。把本地部署作为主力方案,免费 API 当作备选,这样永远不受制于人。使用云端 API 时,请勿上传涉密、涉个人信息的内容。
09 / 自检

动手之前:先看你的电脑能跑多大模型

选错模型大小是新手最容易踩的坑——不是越大越好,而是要装得下。点下面的档位,看你这台机器推荐什么。

🧮 选择你的硬件档位(显存 / 统一内存)

🔍 三行命令,查清你的硬件

Windows · PowerShell(在任务管理器 → 性能 也能直接看)
# 1. 查看显卡型号与显存大小
nvidia-smi

# 2. 查看内存总量(GB)
[math]::Round((Get-CimInstance Win32_ComputerSystem).TotalPhysicalMemory/1GB,1)

# 3. 查看可用磁盘空间(模型很占地方,建议留 50GB 以上)
Get-PSDrive C | Select-Object Used,Free
macOS / Linux · 终端
# macOS:看芯片与统一内存
system_profiler SPHardwareDataType | grep -E "Chip|Memory"

# Linux:看显卡与显存
nvidia-smi
free -h
df -h

📦 量化等级怎么选(这是省显存的关键)

同一个模型有不同"精度版本"。量化 = 用略低的精度换更小的体积,Q4 档几乎看不出质量差别,但体积只有一半

等级相对体积质量建议
Q4_K_M约 100%(基准)很好首选,社区公认的甜点
Q5_K_M约 120%略好显存有余量时用
Q8_0约 190%接近原始显存充足、追求极致
Q3 / Q2约 70% / 55%可感知下降实在装不下时的妥协
格式说明:Windows / Linux / Intel Mac 用 GGUF;Apple Silicon(M 系列)优选 MLX,速度更快。
10 / 部署(核心)

本地免费部署完整教程:从零到能用

三条路线任选其一即可跑通,推荐新手走路线 A,开发者走路线 B,想要网页界面再叠加路线 C。全程 0 元,不需要账号,不需要信用卡。

开始前的三个确认:① 磁盘剩余空间 ≥ 20GB(推荐 50GB);② 网络能下载模型(国内建议配合镜像站,见 10.4);③ 电脑能开机就别关着一半去装驱动。

路线 A · LM Studio:零命令行,图形界面一步步点

适合:完全不想碰命令行的人。整个过程约 15 分钟(含下载模型)。

下载并安装 LM Studio

打开官网 lmstudio.ai,按系统下载:Windows 选 .exe(注意区分 x64 / arm64),macOS 选 .dmg

安装位置建议:安装时把路径改到 D 盘等非系统盘,不要一路"下一步"塞进 C 盘——模型很占空间。

首次启动:改成中文 + 挪走模型目录

  • 左下角齿轮 → GeneralApp Language → 简体中文(部分界面仍是英文,属正常)。
  • 同一页面 → Models Directory → 改成非系统盘的目录(例如 D:\AI\models)。
先把这两项设好再下模型,能省掉后面"磁盘满了"的麻烦。

下载一个模型

点左侧 🔍 搜索图标 → 搜索框输入模型名(例如 Qwen3 8BGemmaLlama)→ 选 Q4_K_M 量化版本 → Download。

列表里会用颜色标出"你的硬件能不能跑"。绿色 = 可以,黄/红色就别勉强,换小一号或换更低量化。

国内网络下载太慢?用镜像手动导入

LM Studio 默认从 Hugging Face 下载,国内可能很慢。做法是:用国内镜像站下载 .gguf 文件,再按它要求的目录结构放进去。

模型目录必须按「发布者 / 仓库名 / 文件.gguf」三层放置
D:\AI\models\
   └─ 我随便起的发布者名\        # 第 1 层
        └─ Qwen3-8B\            # 第 2 层
             └─ Qwen3-8B-Q4_K_M.gguf   # 第 3 层:模型文件本体
镜像站:hf-mirror.com(Hugging Face 镜像,筛选项里可直接选 LM Studio / GGUF);modelscope.cn(国内平台,速度快,需登录)。下载支持断点续传,中断了重新点即可。

加载模型并调三个关键参数

回到对话页 → 顶部选择模型 → 右侧展开加载设置:

  • Context Length(上下文长度):从 4096 起,需要读长文档再往上加(越长约吃内存)。
  • GPU Offload(卸载到显卡的层数):拉到最大;装不下就往下调,让一部分层留在内存里跑。
  • Temperature(随机性):写作用 0.7–1.0,事实核对用 0.2–0.3。

Load,等进度条走完(几秒到一分钟),输入问题即可开始对话。

让它读你的文件(本地知识库)

在聊天窗口直接附加 PDF / TXT / DOCX 文件,模型会在本地解析并回答相关问题——文件不会离开你的电脑

开启本地 API(让别的软件也能用它)

左侧"开发者/本地服务器"图标 → 打开服务开关 → 记下地址,通常是 http://localhost:1234/v1

这一步做完,你的电脑就变成了一个"私人 AI 服务端":任何支持 OpenAI 格式的软件都能接上它,且永不扣费、永不限速

接入常用工具(选做但强烈推荐)

  • ChatBox 等聊天客户端:设置 → 模型提供方 → 添加 → 选 LM Studio/Ollama → 填 API 地址 → 拉取模型列表。
  • VS Code 编程助手(Continue 等插件):模型来源选"本地服务",填同一个地址,代码补全就完全离线了。

路线 B · Ollama:一条命令跑模型(开发者首选)

适合:要自动化、要接入自己的程序、要在服务器上部署。2026 年当前版本为 v0.32.x(版本更新很快,以官网为准)。

安装(选你系统的命令)

Windows · PowerShell(也可直接下 .exe 安装包)
irm https://ollama.com/install.ps1 | iex
macOS / Linux(Linux 会自动装成开机自启服务)
curl -fsSL https://ollama.com/install.sh | sh

# macOS 用 Homebrew 也行
brew install ollama
Docker(服务器 / 群晖等 NAS)
docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama
装完新开一个终端窗口,验证:ollama --version。看到版本号就成功了。

下载并运行你的第一个模型

第一次运行会自动下载,下载完直接进入对话
# 小机器先拿 3B 试水(约 2GB,纯 CPU 也能跑)
ollama run qwen3.5:4b

# 8-16GB 显存:日常中文对话首选
ollama run qwen3:8b

# 24GB 显存:代码与复杂任务
ollama run qwen3.6:27b

# 退出对话:输入 /bye
进入对话后直接打字提问即可。--verbose 可看到生成速度(tokens/s),用来判断性能是否正常。

记住这 6 条命令,日常足够用

Ollama 常用命令
ollama list          # 看已经下载了哪些模型、各占多大
ollama pull qwen3:8b # 只下载,不进对话(适合提前备模型)
ollama run qwen3:8b  # 启动对话
ollama ps            # 看当前哪个模型在显存里、占用多少
ollama rm qwen3:8b   # 删掉模型,释放磁盘
ollama serve         # 手动启动后台服务(默认端口 11434)
磁盘预警:每个模型 2–8GB 起步,大的能到几十上百 GB。定期用 ollama list 检查,不用的用 ollama rm 清掉。

用 API 调用它(这是"免费使用"的核心)

Ollama 启动后会常驻在 http://localhost:11434,并同时提供 OpenAI 兼容接口。先用 curl 测一下:

命令行测试
# 方式一:OpenAI 兼容格式(推荐,几乎所有工具都认)
curl http://localhost:11434/v1/chat/completions -H "Content-Type: application/json" -d "{\"model\":\"qwen3:8b\",\"messages\":[{\"role\":\"user\",\"content\":\"用三句话介绍本地部署大模型的好处\"}]}"

# 方式二:Ollama 原生接口
curl http://localhost:11434/api/generate -d "{\"model\":\"qwen3:8b\",\"prompt\":\"你好\",\"stream\":false}"
Python 调用(先装:pip install openai)
from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:11434/v1",   # 关键:指向本地
    api_key="ollama"                      # 本地不需要真 key,随便填
)

resp = client.chat.completions.create(
    model="qwen3:8b",
    messages=[{"role": "user", "content": "写一份本地AI部署的自查清单"}],
)
print(resp.choices[0].message.content)

五个环境变量,解决 90% 的实际问题

Windows 在「系统属性 → 环境变量」里加;macOS/Linux 写在 ~/.zshrc 或 ~/.bashrc
OLLAMA_MODELS=D:\ollama-models      # 把模型目录挪到非系统盘(省C盘)
OLLAMA_HOST=0.0.0.0:11434           # 允许局域网其他设备访问(手机/另一台电脑)
OLLAMA_KEEP_ALIVE=30m               # 模型在内存里驻留时长,避免每次都重新加载
OLLAMA_NUM_PARALLEL=2               # 同时处理几个请求(显存够再调大)
OLLAMA_FLASH_ATTENTION=1            # 开启闪电注意力,长上下文更省显存、更快
改完必须重启 Ollama 服务才生效(Windows 退出托盘图标重开;Linux:sudo systemctl restart ollama)。

定制一个"专属助手"(Modelfile)

用 Modelfile 把系统提示词、参数固化成你自己的模型,之后一条命令就能调用。

新建文件 MyAssistant.Modelfile,内容如下
FROM qwen3:8b
PARAMETER temperature 0.3
PARAMETER num_ctx 8192
SYSTEM """
你是我的私人助理。回答要求:
1. 先给结论,再给依据,不要客套话;
2. 涉及数字必须标注来源或说明是估算;
3. 不确定时直接说不确定,不要编造。
"""
创建并使用
ollama create my-assistant -f MyAssistant.Modelfile
ollama run my-assistant

会话中临时改参数

在 ollama run 的对话界面里直接输入
/set parameter num_ctx 16384     # 临时把上下文拉到 16K,读长文档用
/set parameter temperature 0.2   # 让输出更稳定
/show info                       # 看当前模型的参数与模板
/bye                             # 退出

路线 C · Open WebUI:给本地模型套一个 ChatGPT 式网页

适合:想要网页界面、多用户、文档知识库的人。前提是已经装好 Ollama(路线 B)。

方式一:Docker 一条命令(最省事)

装好 Docker Desktop 后执行
docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:main

方式二:pip 安装(不用 Docker)

需要 Python 3.11 左右的环境
pip install open-webui
open-webui serve

# 然后浏览器打开 http://localhost:8080

首次进入:建一个本地管理员账号

第一个注册的账号会自动成为管理员,账号只存在你自己的电脑上,不是云端注册。

连接本地 Ollama

设置 → 连接(Connections)→ Ollama 地址填:

  • Docker 安装:http://host.docker.internal:11434
  • pip 安装:http://127.0.0.1:11434

保存后,顶部模型下拉框里就能看到 ollama list 里的全部模型,点选即可对话。

到这里你已经拥有一个完全属于自己的 ChatGPT,且:不花钱、不限额、断网可用、对话记录只在本机

三种"免费使用"的进阶姿势

  • 文档知识库:把公司制度、产品手册上传到"知识库",之后提问会自动引用这些资料(本地向量检索,数据不出本机)。
  • 局域网共享:设置 OLLAMA_HOST=0.0.0.0:11434,手机 / 平板浏览器访问 http://你的电脑IP:8080,全家都能用。
  • 接入你的程序:任何语言都可以请求 http://localhost:11434/v1/chat/completions,把它当作免费的云端 API 来写代码。

路线 D · 进阶(服务器 / 多人协作)

需求方案关键命令 / 说明
多人同时用、吞吐量要高vLLMpip install vllmvllm serve 模型路径,默认开 OpenAI 兼容接口,适合团队/生产
老电脑、内存小小参数模型 + 低量化选 3B–4B 的 Q4 版本,纯 CPU 也能跑到"比人阅读更快"
想微调成自己的专属模型LoRA 微调用 LLaMA-Factory 等开源工具,消费级显卡即可做小规模微调
要用本地模型驱动 Agent工具调用 + MCPOllama / vLLM 都支持工具调用;配合 MCP 协议可接搜索、文件、数据库

10.4 模型下载网络加速(国内必看)

🚀 三个可靠渠道

  • hf-mirror.com:Hugging Face 镜像,搜模型 → 选 GGUF → 下载单文件即可。
  • modelscope.cn(魔搭):国内官方平台,速度最快,需登录;同时提供免费 API 额度。
  • Ollama 官方库ollama pull 走官方 CDN,多数情况下速度尚可,且原生支持断点续传。
小技巧:大模型下载优先在夜里挂机;LM Studio 支持断点续传,中断了直接重点,不会从头开始。

💰 成本对照:为什么说这套方案是 0 元

项目本地部署付费 API
软件开源免费
模型免费下载(注意许可证)按 token 计费
使用量无限用多少扣多少
隐私数据不出本机内容会上传
离线可用不可用
上限受你的硬件限制能力最强
结论:本地方案的成本只有电费。模型许可证要留意——大多数开源模型允许个人与商用,但部分有特殊条款,下载页会写明。
11 / 调试

免费调试排错手册:14 个高频问题,对症下药

本地部署 90% 的"失败"都不是坏了,而是配置没对上。按下面的表逐条对照即可。

现象原因解决办法
加载模型报 Out of Memory / 显存不足模型体积超过显存换更低量化(Q4→Q3)或更小参数;把 GPU 卸载层数调低,让部分层跑在内存;关掉浏览器、游戏等占显存的程序;调小上下文长度
Failed to load model文件不完整或目录层级不对检查 .gguf 文件是否下载完整(大小对得上);LM Studio 必须是「发布者/仓库/文件」三层结构
下载卡在某个百分比网络波动点暂停再继续(支持断点续传);换 hf-mirror 或 ModelScope 手动下载
输出速度很慢(几秒一个字)在用 CPU 推理,或上下文太大确认 GPU 是否被识别(ollama ps 看是否 100% CPU);把上下文从 32K 降到 8K,速度常能翻倍;换 3B–8B 小模型
识别不到 NVIDIA 显卡驱动过旧显卡驱动需较新版本(Ollama 要求 compute capability 5.0+、驱动 550 以上,老卡需 570);更新驱动后重启
AMD 显卡不加速ROCm 支持有限Linux 用 ROCm v7+;Windows 仅部分 7000 系列/PRO 卡支持;不支持时自动回退 CPU,仍可正常使用
Mac 跑得比想象中快/慢统一内存架构差异M 系列用 Metal 自动加速,优选 MLX 版本模型;内存买定不可升级,装大模型前先算好
回答全是英文模型默认语言倾向明确要求"用中文回答";或在系统提示词里固定中文;优先选中文能力强的模型
端口被占用(11434 / 1234 / 3000)已有同端口服务Windows:netstat -ano | findstr 11434 查进程后结束;或改端口启动
Docker 里连不上 Ollama容器网络隔离http://host.docker.internal:11434,并在启动容器时加 --add-host=host.docker.internal:host-gateway
局域网 / 手机访问不了只监听了本机OLLAMA_HOST=0.0.0.0:11434 并重启服务;放通防火墙对应端口;用电脑内网 IP 访问
回答又长又重复、绕圈随机性与重复惩罚参数不合适降低 temperature(0.2–0.4),适当提高重复惩罚,在提示词里加"简洁回答,不超过 N 字"
一本正经地编造(幻觉)它的本质是概率续写降低 temperature;把资料作为上下文喂给它(RAG);要求"只依据给定资料回答,没有就说没有";关键结论必须自己核实
提示上下文超长报错输入超过窗口上限调大 num_ctx(吃内存),或把长文档切分后再问,或换支持长上下文的模型

性能优化六件事

  • 模型放 SSD,别放机械硬盘或移动硬盘
  • 开启 Flash AttentionOLLAMA_FLASH_ATTENTION=1
  • 上下文够用就好,别默认拉满
  • GPU 卸载层数尽量拉高,装不下再减
  • 把常用模型设 常驻内存,省掉反复加载
  • 同时只跑一个模型,别开多任务

🧪 判断"是否正常"的三个基准

用 8–14B 模型、Q4 量化、普通对话场景参考:

  • 有独显:每秒 20–60 字属正常
  • 纯 CPU:小模型 25 字/秒左右,大模型会明显变慢
  • 参考线:人正常阅读约 5–8 字/秒,比这个快就算可用
实测参考(12 核 CPU + 22GB 内存、无独显):0.8B 模型约 60 字/秒,4B 约 26 字/秒,8B 约 25 字/秒。

🔐 安全与合规提醒

  • 本地部署 ≠ 绝对安全:API 不要随便暴露到公网,局域网共享要设防火墙规则
  • 让 Agent 操作文件时,限定目录范围,别给整盘权限
  • 开源模型许可证要看清,商用前确认条款
  • 模型输出不能直接当作专业结论(医疗、法律、财务必须人工复核)
12 / 周报

AI 周报:上周与本周发生了什么

覆盖 2026-09-14 ~ 09-20(上周)2026-09-21 ~ 09-27(本周,滚动更新至 09-22)。信息整理自公开报道与行业周报,具体数据请以官方公告为准

09.14 全球半导体指数单日暴跌,市值蒸发规模
0新一代旗舰模型训练所用 GPU 数量级
0Grok 4.7 参数规模(较上代增长约 40%)
0智谱 9.18 完成的 H 股配售总额
0昇腾 960 超节点单引擎传输容量
09.14 · 政策

《人工智能安全治理框架 3.0》发布

全国网络安全标准化技术委员会在 2026 年国家网络安全宣传周开幕式发布该框架,针对智能体(Agent)、多模态等新形态提出更细化的安全要求,安全治理从"原则"走向"可落地条款"。

国内安全治理来源:公开发布信息
09.14 · 市场

"AI 减速论"引发市场巨震

头部厂商负责人相继公开呼吁为前沿模型研发"踩刹车",叠加估值担忧,美股半导体指数当日暴跌约 6%,市值蒸发超 3000 亿美元,A 股算力板块同步分化。

行业局势资本市场来源:行业周报(09.21)
09.16 · 基建

首个"AI 能源管理联盟"成立

英伟达、谷歌与 Emerald AI 联合成立全球首个 AI 能源管理联盟,推动数据中心按电网状况动态用电。同期行业共识转向:AI 扩张的瓶颈已从芯片转向电力

算力基建能源瓶颈
09.17 · 国产算力

昇腾生态跨越拐点,NPO 超节点亮相

华为全联接大会披露:昇腾超节点部署超 1000 套、昇腾 950 规模商用;并发布业界首个采用 NPO(近封装光学)技术的昇腾 960 超节点,单引擎传输容量 7.2T,直指集群"内存墙、功耗墙"。

国产替代光互连
09.18 · 模型

GLM-5.3-FlashX 发布,并首次公开 RSI 实践

智谱发布推理速度达 200 tokens/s 的新版本,同时公开国内首个 RSI(递归自我改进)工程化闭环——用模型自动设计并优化自身推理基础设施。同日完成约 156.83 亿港元 H 股配售,投向下一代模型与算力。

模型更新自我改进
09.18 · 科研

通用医疗影像模型登上《Science》

阿里达摩院 DAMO RADAR 可一次性识别 146 种病症并登上《Science》正刊,标志着多病种统一识别的通用医疗模型进入主流学术验证阶段。

医疗 AI顶级期刊
09.18 · 监管

加州签署行政令:前沿模型要有"紧急关闭开关"

美国地方层面出现明显趋严信号,要求最先进模型开发紧急关闭机制;与此同时联邦层面倾向"轻度监管",全球 AI 治理出现罕见的路线分歧。

监管海外
09.20 · 开源

开源侧两个大动作:Step 5 Preview 与 Qwen-Image-2.1

阶跃星辰开源旗舰基座 Step 5 Preview,在全球开源榜单跻身前三;阿里千问开源图像生成模型 Qwen-Image-2.1,国产 GPU 厂商同日完成 Day 0 适配,实现"发布即适配"。

开源模型国产芯片
09.20 · 产业

开源与垂类模型被列为重点方向

工信部在 2026 世界制造业大会上强调"大力发展开源基座模型和垂类模型";上海新增 12 款完成登记的生成式 AI 服务,累计达 236 款。开源+垂直行业成为国产落地的共同路径。

产业政策利好开源
09.16 – 09.20 · 资本

资本继续涌向"卖水人"

地瓜机器人完成 4 亿美元 C 轮(专注机器人芯片与软件平台);Crusoe 完成 39 亿美元 F 轮,投后估值 309 亿美元;瑞银将 2027 年全球 AI 资本支出预测上调至约 1.4 万亿美元,其中约九成增量来自内存涨价。

投融资硬件/基建
本周仍在进行中,以下为截至 09-22 已发生/已披露的信息,页面后续可继续补充。
09.21 · 市场逻辑

投资主线切换:从"追性能峰值"到"看安全与确定性"

周度综述指出,本周行业呈现"模型轮动加速、算力门槛抬升、资本务实下沉"三大特征。算力硬基建(光互连、存储、先进封装)被视为中期确定性最强的方向,而前端模型厂商的商业化路径不确定性上升。

行业局势投资逻辑
09.21 · 竞争格局

2.1 万亿参数模型打起价格战

Grok 4.7 以远低于前沿旗舰的定价策略成为焦点,业内评价其为"便宜的第二种意见"而非替代方案——参数规模不再是唯一卖点,单位成本性能成为新战场。

价格战大模型
09.21 – 09.22 · 开源

百万级上下文以宽松许可放开

据行业资讯汇编,DeepSeek V4.1-Flash 以 MIT 许可开放 1M 级上下文——对本地与自建部署者而言,这意味着长文档、代码库级别的处理能力可以用极低成本获得。

开源许可长上下文
09.21 · 资本

智谱持续加码自建算力

继 09.18 完成约 156.83 亿港元 H 股配售(另有周报提及新一轮大额融资,具体以公司公告为准)后,资金明确投向下一代 GLM 模型与自建算力基础设施,走"模型 + 算力"垂直一体化路线。

融资国产大模型
本周 · 供应链

算力租赁与零部件涨价压力持续

云服务商宣布自 10 月 1 日起上调 GPU 租赁费用(最新一代卡涨幅最高约 21%);韩国半导体零部件出现短缺,交付周期被拉长。对个人用户的直接影响是:云端成本上升,本地部署的性价比进一步提高。

涨价供应链
本周 · 应用

企业级 Agent 继续跑通 ROI

编程、网络安全、金融投研是率先落地的场景;行业测算显示,若递归自我改进类技术常态化,大型模型的推理运维成本有望下降 30%–50%。Agent 的竞争焦点正从"能不能做"转向"做得多省"。

智能体落地场景

⚙️ 主线一:模型轮动加速

9 月以来旗舰模型密集发布,竞争焦点从"谁的分数高"转向"谁能自主完成任务",以及"谁的单位成本更低"。开源与闭源的差距已缩小到数月级别。

🔌 主线二:瓶颈从芯片转向能源

训练进入十万卡量级后,电力、散热、内存成为真正的约束。能源联盟、绿电直连、光电共封装等话题从"基建新闻"变成"行业主线"。

⚖️ 主线三:安全治理进入立法落地期

国内发布安全治理框架 3.0 并推进服务登记;海外则在"强监管"与"轻度监管"之间激烈博弈,甚至出现对头部厂商的反垄断诉讼。合规能力正成为企业选型的硬指标。

👀 下周(及 10 月初)值得关注

  • 美国科技巨头 Q3 业绩指引——直接影响算力板块情绪
  • 10 月 1 日起 GPU 租赁涨价落地,自建/本地的性价比进一步凸显
  • 国产开源模型与国产芯片的"发布即适配"能否形成常态
  • 智能体工具标准(工具调用、MCP 类协议)的统一进展

🙋 对普通人意味着什么

  • 能力上:开源模型已经能覆盖大部分日常任务,本地可用不再是妥协
  • 成本上:云端涨价,本地部署的"零边际成本"优势更明显
  • 风险上:AI 生成内容与自动化操作都在被规范,使用时要留痕、要合规
  • 行动上:现在就按本页第 10 节装一个本地模型,是最划算的一步
免责声明:本周报内容整理自公开报道、官方发布信息与第三方行业周报,用于学习与信息参考,可能存在滞后或偏差,不构成任何投资建议。涉及金额、参数、日期等数据,请以相关公司或机构的官方公告为准。
13 / 清单

动手资源清单(复制即用)

把常用地址集中在这里,点击按钮即可复制。

🔗 工具与模型官网

常用地址
Ollama 官网          https://ollama.com
Ollama 模型库        https://ollama.com/library
LM Studio 官网       https://lmstudio.ai
Open WebUI 官网      https://openwebui.com
llama.cpp 仓库       https://github.com/ggml-org/llama.cpp
vLLM 官方文档        https://docs.vllm.ai

🌏 国内加速与平台

下载与免费额度
Hugging Face 镜像    https://hf-mirror.com
魔搭 ModelScope      https://modelscope.cn
硅基流动(免费额度)  https://cloud.siliconflow.cn
智谱开放平台         https://open.bigmodel.cn
阿里云百炼           https://bailian.console.aliyun.com
火山方舟(豆包)      https://console.volcengine.com/ark
最后一句实话:本地小模型不会比云端旗舰更聪明,但它免费、无限量、离线、私密。对 90% 的日常任务来说,这就够了——而这件事你今天就能做完。