AGI(Artificial General Intelligence,通用人工智能)指的是:一个模型不经过专门训练,就能像人一样跨领域理解、推理、学习并解决新问题的能力。 它和我们今天用的 AI 最大的差别不是"更聪明",而是"不用为每个任务单独做一套系统"。
只能在单一任务上表现出色:人脸识别、语音转写、推荐算法、翻译。今天的绝大多数 AI 都属于这一类,换个任务就失效。
能跨领域迁移:会用你教它的方法去处理它从没见过的新问题,能自己规划多步骤任务、使用工具、从反馈中自我修正。
在几乎所有认知维度上远超人类最顶尖的专家,并且能自我改进。目前属于理论阶段,也是全球治理讨论的焦点。
注意滑块在"通用"区间的停留时间最长——这正是 2024 年以来行业所在的位置:单一任务的冠军很多,跨任务的通才刚刚出现。
ANI 时代(2022 年前)
你要做一个"合同审查系统",需要:收集标注数据 → 训练专用模型 → 上线 → 合同类型一变就重新训练。
AGI 思路(2024 年后)
直接把合同丢给通用模型,用自然语言说明规则,它自己读、自己找风险点、自己生成修改建议,你以为它不会的新格式,它也能举一反三。
下面每一条都不是畅想,而是 2025—2026 年已经出现的能力形态。点击卡片查看"它到底做了什么"。
需求 → 代码 → 自测 → 修复,闭环完成。
百万级上下文,跨文档检索与比对。
翻译、改写、润色、风格迁移。
图像 / 语音 / 视频 / 文本统一处理。
给目标,不给步骤,自己拆解执行。
从数据中生成假设、验证、给结论。
图、视频、音乐、3D,文字直出。
替你点鼠标、填表格、整理资料。
(这里会显示该能力的实际表现、能达到什么程度、以及目前还做不到什么。)
把 2017 年以来的关键节点连起来看,主线非常清晰:模型规模持续放大 → 能力从单模态走向多模态 → 交互从对话走向自主执行 → 部署从云端走向端侧与本地。
"注意力机制"论文发表,奠定了此后所有大模型的基础架构。
GPT-3 证明"参数 + 数据 + 算力同步放大,能力可预测提升";ChatGPT 让普通人第一次用上大模型。
模型开始同时理解图文音视频;开源模型与闭源旗舰的差距从"代差"缩小到"几个月"。
工具调用、长任务规划、电脑操作成为主线。开源侧,2026 年 9 月阶跃星辰开源旗舰基座跻身全球开源榜前三,阿里开源图像模型与国产 GPU 实现"发布即适配"。
新一代旗舰模型明确以"具备自主执行能力"为定位,训练动用超 10 万块 GPU;同时业内开始公开讨论"要不要踩刹车"——瓶颈已从芯片蔓延到电力。
参数、数据、算力同步放大,性能仍按可预测的幂律提升,前沿训练已进入"十万卡"量级。但同期也出现了公开的"减速"争论:一方面有人呼吁为前沿研发踩刹车,另一方面新的瓶颈已经从芯片转移到电力与能源——2026 年 9 月,英伟达、谷歌等联合成立了 AI 能源管理联盟,推动数据中心按电网状况动态用电。
27B 级模型量化后只要 17GB 显存,纯 CPU 也能跑到"比人阅读速度快"的输出速度。这意味着:离线、免费、数据不出门的 AI 已经从极客玩具变成日常可用工具——本页后半部分就是完整落地教程。
单一模型的智力提升正在放缓,实际系统的能力提升越来越多来自智能体工程:任务分解、工具调用(搜索、代码执行、数据库)、记忆与反思、多智能体协作。2026 年的产业共识是:模型是发动机,智能体才是车。
下面每个场景都配了 2026 年真实发生的案例。切换标签即可查看(页面也会自动轮播)。
过去一张片子要一位医生逐个病灶看;现在通用模型可以直接输出"看到什么、位置在哪、可能性多大",医生做最终判断,效率提升数倍。
在基层医院和体检场景,这类能力相当于把三甲医院的阅片经验复制到每一个乡镇卫生院。
模型不只是回答题目,而是判断你为什么错:是概念没建立、还是计算习惯问题,然后给出针对性练习。
对老师而言,批改、出题、学情分析这些重复劳动被接管,备课时间可以真正用在设计教学内容上。
智能体可以跨系统取数:读会议纪要、连表格、生成周报、发到群里,中间不需要你复制粘贴。它改变的是流程,不只是文字。
这也是 2026 年企业侧增长最快的方向——编程、网络安全、客服等场景的订单验证了它的降本效果。
智能驾驶本质是"多模态 + 实时决策"的 AGI 应用:看懂画面、预测他车意图、在毫秒级给出动作。大模型让长尾场景(施工、异形障碍物)的处理能力明显提升。
写脚本、出分镜、生成画面、配音配乐、剪辑成片,过去需要一个团队配合,现在一个创作者可以用自然语言串起来。
2026 年的明显变化是实时性:视频流可以边生成边编辑,数字角色可以实时对话,不再需要"生成—等待—再生成"。
把模型装在自己电脑上,写周报、改合同、整理资料、做翻译——不按 token 计费、没有使用次数限制、断网也能用,敏感资料永远不会离开你的硬盘。
这就是本页后半部分要教你的东西:从装软件到跑起来,全流程免费。往下翻到 「本地免费部署」。
别看参数上千亿,运转逻辑只有六个步骤,而且循环往复。观看下面这条流水线(点击任意环节可看细节)。
你输入的每个字对模型来说都不是"意思",而是待处理的符号序列。模型没有记忆中的"字典答案",它做的第一件事是把你的问题切成它认识的单位。
处理每个词时,模型会去"看"句子里的其他词,判断谁和谁关系大。下面这句话,模型理解"它"指的是"石头",靠的就是注意力权重。
网格 = 注意力权重矩阵:越亮的格子表示两个词之间的关联越强。
以"今天天气真"为输入,模型算出的不是一个确定答案,而是所有可能的下一个词的分数:
把模型当"人"去猜它的思路,几乎一定会猜错。理解下面五条,你就会用得好很多。
它没有数据库可查,而是在海量文本里学到了"什么样的上下文后面通常接什么"。所以它答得流畅,但流畅 ≠ 正确。
直接问答案,它容易顺着最顺口的方向编;让它一步步推导(思维链),正确率会明显提升——因为每一步都是新的"上下文",后面的判断能看到前面的过程。
它"记得"的只是这次对话窗口里的内容,窗口一关就归零。所谓"它认识我",要么是它读了你给的资料,要么是外部系统把资料重新喂给了它。
这是"温度"参数在起作用:写文案时你要它发散,做数据核对时你要它收敛。
它极擅长从大量例子中找到共同模式,然后把模式套到新情况上;但它不天然遵守严格的形式逻辑,容易被"看起来很合理"的表述带偏(比如顺着你的错误前提往下编)。
点击按钮,看模型(示意)如何从"直接下结论"切换到"分步推理"。
若直接问"涨 20% 再打八折是多少",很多模型会脱口而出"还是 200"——跳步是出错的头号原因。
从"你问我答"到"你给目标我干活",中间靠的是一个不断重复的闭环。下面的循环会自动演示,右侧是它处理一个真实任务的完整过程。
不是收到一条条指令,而是收到一句目标 + 约束(要免费、要能离线、要有对比表)。
把目标拆成可执行步骤:列出待选工具 → 查各自要求 → 查模型体积 → 归纳对比维度。
真的去执行:联网搜索、读文档、跑命令查显存、写文件。工具是它补足自身短板的手。
看返回了什么:搜索有结果吗、命令报错吗、数据缺哪一项。
发现缺项就改计划重跑;发现假设错了就换路径。这一环是 Agent 与普通问答的分水岭。
输出对比表,并自检是否满足全部约束;不符合就回到第 2 步。
搜索、代码执行、文件读写、数据库查询、调用第三方 API。2026 年这些能力已经标准化:工具调用(Tool Calling) 成为模型基础能力,还有 MCP 这类统一协议让不同工具即插即用。
复杂任务会拆给多个专职智能体:一个查资料、一个写、一个审。真实案例:2026 年 9 月,约一万个 AI 智能体协作约 88 小时,给出了纳维–斯托克斯方程难题的解答,并附上形式化验证代码。
权限风险:能操作文件/系统的智能体,一定要限定目录与操作范围。
跑偏风险:目标表述含糊时,它会"很努力地做错事"。
成本风险:循环次数失控会烧掉大量额度——本地部署的好处之一就是没有 token 账单。
先用一张表把路线分清:要隐私和无限量 → 本地跑;要最强大模型 → 用平台免费额度;只想试试 → 网页直接用。本页主推第一条,因为它真正"免费且不受限"。
把模型下载到自己电脑。软件全部开源免费,没有次数限制、不用注册、断网可用、数据不出本机。唯一成本是电费和硬盘空间。
注册国内平台领免费 token,调用云端最强模型。有额度上限、需要联网、数据要出本机。适合和本地方案搭配:日常用本地,攻坚用云端。
打开网站就能用,零安装。适合验证"这个模型能不能干我的活",但不可自动化、不可集成到你的软件里。
| 工具 | 形式 | 免费情况 | 适合谁 | 一句话说明 |
|---|---|---|---|---|
| Ollama | 命令行 + 后台服务 | 开源免费(MIT) | 开发者、要自动化/接入软件 | 一条命令跑模型,自带 OpenAI 兼容 API,生态最广 |
| LM Studio | 图形界面桌面软件 | 个人使用免费 | 新手、不想碰命令行 | 像装个聊天软件一样,内置模型商店,一键下载加载 |
| Open WebUI | 网页界面(浏览器打开) | 开源免费 | 想要 ChatGPT 式界面 | 给本地模型套一个网页壳,支持多用户、文档问答 |
| llama.cpp | 底层推理引擎 | 开源免费 | 要极致控制/嵌入式 | 纯 C++ 实现,CPU 推理的鼻祖,上面两个工具都基于它 |
| vLLM | 服务器框架 | 开源免费 | 多人在线、高并发 | 吞吐量极高,适合部署给团队用;单机自用没必要 |
| 平台 | 免费额度(参考) | 特点 | 适合场景 |
|---|---|---|---|
| 智谱 AI | GLM-4-Flash 系列永久免费 + 新用户赠送 token | 中文写作强,并发较高 | 中文文案、日常问答 |
| 硅基流动 | 注册赠送 token + 部分模型永久免费 | 模型种类国内最多(100+) | 想横向比不同开源模型 |
| ModelScope 魔搭 | 每日约 2000 次请求(跨模型总量) | 需绑定账号实名,Qwen 系列齐 | 国内下载模型 + 调 API |
| 阿里云百炼 | 新用户大额 token 赠送 + 每模型试用 | 模型覆盖广,企业常用 | 做原型、做应用 |
| 火山引擎(豆包) | 每日赠送 token,按天重置 | 并发高,适合批量 | 高并发测试 |
| DeepSeek 开放平台 | 注册赠送 token | 代码/推理性价比高 | 写代码、复杂推理 |
| 百度千帆 / 讯飞星火 | 部分轻量模型永久免费 | 合规场景友好 | 国内合规要求高的项目 |
| Google AI Studio / Groq / Cerebras | 每日免费请求额度(国外,需可访问网络) | Groq、Cerebras 速度极快 | 追求响应速度的测试 |
| OpenRouter | 每日免费模型调用次数(聚合平台) | 一个 Key 调 50+ 模型 | 多渠道对比 |
选错模型大小是新手最容易踩的坑——不是越大越好,而是要装得下。点下面的档位,看你这台机器推荐什么。
# 1. 查看显卡型号与显存大小 nvidia-smi # 2. 查看内存总量(GB) [math]::Round((Get-CimInstance Win32_ComputerSystem).TotalPhysicalMemory/1GB,1) # 3. 查看可用磁盘空间(模型很占地方,建议留 50GB 以上) Get-PSDrive C | Select-Object Used,Free
# macOS:看芯片与统一内存 system_profiler SPHardwareDataType | grep -E "Chip|Memory" # Linux:看显卡与显存 nvidia-smi free -h df -h
同一个模型有不同"精度版本"。量化 = 用略低的精度换更小的体积,Q4 档几乎看不出质量差别,但体积只有一半。
| 等级 | 相对体积 | 质量 | 建议 |
|---|---|---|---|
| Q4_K_M | 约 100%(基准) | 很好 | 首选,社区公认的甜点 |
| Q5_K_M | 约 120% | 略好 | 显存有余量时用 |
| Q8_0 | 约 190% | 接近原始 | 显存充足、追求极致 |
| Q3 / Q2 | 约 70% / 55% | 可感知下降 | 实在装不下时的妥协 |
GGUF;Apple Silicon(M 系列)优选 MLX,速度更快。三条路线任选其一即可跑通,推荐新手走路线 A,开发者走路线 B,想要网页界面再叠加路线 C。全程 0 元,不需要账号,不需要信用卡。
适合:完全不想碰命令行的人。整个过程约 15 分钟(含下载模型)。
打开官网 lmstudio.ai,按系统下载:Windows 选 .exe(注意区分 x64 / arm64),macOS 选 .dmg。
D:\AI\models)。点左侧 🔍 搜索图标 → 搜索框输入模型名(例如 Qwen3 8B、Gemma、Llama)→ 选 Q4_K_M 量化版本 → Download。
LM Studio 默认从 Hugging Face 下载,国内可能很慢。做法是:用国内镜像站下载 .gguf 文件,再按它要求的目录结构放进去。
D:\AI\models\ └─ 我随便起的发布者名\ # 第 1 层 └─ Qwen3-8B\ # 第 2 层 └─ Qwen3-8B-Q4_K_M.gguf # 第 3 层:模型文件本体
hf-mirror.com(Hugging Face 镜像,筛选项里可直接选 LM Studio / GGUF);modelscope.cn(国内平台,速度快,需登录)。下载支持断点续传,中断了重新点即可。回到对话页 → 顶部选择模型 → 右侧展开加载设置:
点 Load,等进度条走完(几秒到一分钟),输入问题即可开始对话。
在聊天窗口直接附加 PDF / TXT / DOCX 文件,模型会在本地解析并回答相关问题——文件不会离开你的电脑。
左侧"开发者/本地服务器"图标 → 打开服务开关 → 记下地址,通常是 http://localhost:1234/v1。
适合:要自动化、要接入自己的程序、要在服务器上部署。2026 年当前版本为 v0.32.x(版本更新很快,以官网为准)。
irm https://ollama.com/install.ps1 | iex
curl -fsSL https://ollama.com/install.sh | sh
# macOS 用 Homebrew 也行
brew install ollama
docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama
ollama --version。看到版本号就成功了。# 小机器先拿 3B 试水(约 2GB,纯 CPU 也能跑) ollama run qwen3.5:4b # 8-16GB 显存:日常中文对话首选 ollama run qwen3:8b # 24GB 显存:代码与复杂任务 ollama run qwen3.6:27b # 退出对话:输入 /bye
--verbose 可看到生成速度(tokens/s),用来判断性能是否正常。ollama list # 看已经下载了哪些模型、各占多大 ollama pull qwen3:8b # 只下载,不进对话(适合提前备模型) ollama run qwen3:8b # 启动对话 ollama ps # 看当前哪个模型在显存里、占用多少 ollama rm qwen3:8b # 删掉模型,释放磁盘 ollama serve # 手动启动后台服务(默认端口 11434)
ollama list 检查,不用的用 ollama rm 清掉。Ollama 启动后会常驻在 http://localhost:11434,并同时提供 OpenAI 兼容接口。先用 curl 测一下:
# 方式一:OpenAI 兼容格式(推荐,几乎所有工具都认) curl http://localhost:11434/v1/chat/completions -H "Content-Type: application/json" -d "{\"model\":\"qwen3:8b\",\"messages\":[{\"role\":\"user\",\"content\":\"用三句话介绍本地部署大模型的好处\"}]}" # 方式二:Ollama 原生接口 curl http://localhost:11434/api/generate -d "{\"model\":\"qwen3:8b\",\"prompt\":\"你好\",\"stream\":false}"
from openai import OpenAI client = OpenAI( base_url="http://localhost:11434/v1", # 关键:指向本地 api_key="ollama" # 本地不需要真 key,随便填 ) resp = client.chat.completions.create( model="qwen3:8b", messages=[{"role": "user", "content": "写一份本地AI部署的自查清单"}], ) print(resp.choices[0].message.content)
OLLAMA_MODELS=D:\ollama-models # 把模型目录挪到非系统盘(省C盘) OLLAMA_HOST=0.0.0.0:11434 # 允许局域网其他设备访问(手机/另一台电脑) OLLAMA_KEEP_ALIVE=30m # 模型在内存里驻留时长,避免每次都重新加载 OLLAMA_NUM_PARALLEL=2 # 同时处理几个请求(显存够再调大) OLLAMA_FLASH_ATTENTION=1 # 开启闪电注意力,长上下文更省显存、更快
sudo systemctl restart ollama)。用 Modelfile 把系统提示词、参数固化成你自己的模型,之后一条命令就能调用。
FROM qwen3:8b PARAMETER temperature 0.3 PARAMETER num_ctx 8192 SYSTEM """ 你是我的私人助理。回答要求: 1. 先给结论,再给依据,不要客套话; 2. 涉及数字必须标注来源或说明是估算; 3. 不确定时直接说不确定,不要编造。 """
ollama create my-assistant -f MyAssistant.Modelfile ollama run my-assistant
/set parameter num_ctx 16384 # 临时把上下文拉到 16K,读长文档用 /set parameter temperature 0.2 # 让输出更稳定 /show info # 看当前模型的参数与模板 /bye # 退出
适合:想要网页界面、多用户、文档知识库的人。前提是已经装好 Ollama(路线 B)。
docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:main
pip install open-webui
open-webui serve
# 然后浏览器打开 http://localhost:8080
第一个注册的账号会自动成为管理员,账号只存在你自己的电脑上,不是云端注册。
设置 → 连接(Connections)→ Ollama 地址填:
http://host.docker.internal:11434http://127.0.0.1:11434保存后,顶部模型下拉框里就能看到 ollama list 里的全部模型,点选即可对话。
OLLAMA_HOST=0.0.0.0:11434,手机 / 平板浏览器访问 http://你的电脑IP:8080,全家都能用。http://localhost:11434/v1/chat/completions,把它当作免费的云端 API 来写代码。| 需求 | 方案 | 关键命令 / 说明 |
|---|---|---|
| 多人同时用、吞吐量要高 | vLLM | pip install vllm → vllm serve 模型路径,默认开 OpenAI 兼容接口,适合团队/生产 |
| 老电脑、内存小 | 小参数模型 + 低量化 | 选 3B–4B 的 Q4 版本,纯 CPU 也能跑到"比人阅读更快" |
| 想微调成自己的专属模型 | LoRA 微调 | 用 LLaMA-Factory 等开源工具,消费级显卡即可做小规模微调 |
| 要用本地模型驱动 Agent | 工具调用 + MCP | Ollama / vLLM 都支持工具调用;配合 MCP 协议可接搜索、文件、数据库 |
ollama pull 走官方 CDN,多数情况下速度尚可,且原生支持断点续传。| 项目 | 本地部署 | 付费 API |
|---|---|---|
| 软件 | 开源免费 | — |
| 模型 | 免费下载(注意许可证) | 按 token 计费 |
| 使用量 | 无限 | 用多少扣多少 |
| 隐私 | 数据不出本机 | 内容会上传 |
| 离线 | 可用 | 不可用 |
| 上限 | 受你的硬件限制 | 能力最强 |
本地部署 90% 的"失败"都不是坏了,而是配置没对上。按下面的表逐条对照即可。
| 现象 | 原因 | 解决办法 |
|---|---|---|
加载模型报 Out of Memory / 显存不足 | 模型体积超过显存 | 换更低量化(Q4→Q3)或更小参数;把 GPU 卸载层数调低,让部分层跑在内存;关掉浏览器、游戏等占显存的程序;调小上下文长度 |
Failed to load model | 文件不完整或目录层级不对 | 检查 .gguf 文件是否下载完整(大小对得上);LM Studio 必须是「发布者/仓库/文件」三层结构 |
| 下载卡在某个百分比 | 网络波动 | 点暂停再继续(支持断点续传);换 hf-mirror 或 ModelScope 手动下载 |
| 输出速度很慢(几秒一个字) | 在用 CPU 推理,或上下文太大 | 确认 GPU 是否被识别(ollama ps 看是否 100% CPU);把上下文从 32K 降到 8K,速度常能翻倍;换 3B–8B 小模型 |
| 识别不到 NVIDIA 显卡 | 驱动过旧 | 显卡驱动需较新版本(Ollama 要求 compute capability 5.0+、驱动 550 以上,老卡需 570);更新驱动后重启 |
| AMD 显卡不加速 | ROCm 支持有限 | Linux 用 ROCm v7+;Windows 仅部分 7000 系列/PRO 卡支持;不支持时自动回退 CPU,仍可正常使用 |
| Mac 跑得比想象中快/慢 | 统一内存架构差异 | M 系列用 Metal 自动加速,优选 MLX 版本模型;内存买定不可升级,装大模型前先算好 |
| 回答全是英文 | 模型默认语言倾向 | 明确要求"用中文回答";或在系统提示词里固定中文;优先选中文能力强的模型 |
| 端口被占用(11434 / 1234 / 3000) | 已有同端口服务 | Windows:netstat -ano | findstr 11434 查进程后结束;或改端口启动 |
| Docker 里连不上 Ollama | 容器网络隔离 | 用 http://host.docker.internal:11434,并在启动容器时加 --add-host=host.docker.internal:host-gateway |
| 局域网 / 手机访问不了 | 只监听了本机 | 设 OLLAMA_HOST=0.0.0.0:11434 并重启服务;放通防火墙对应端口;用电脑内网 IP 访问 |
| 回答又长又重复、绕圈 | 随机性与重复惩罚参数不合适 | 降低 temperature(0.2–0.4),适当提高重复惩罚,在提示词里加"简洁回答,不超过 N 字" |
| 一本正经地编造(幻觉) | 它的本质是概率续写 | 降低 temperature;把资料作为上下文喂给它(RAG);要求"只依据给定资料回答,没有就说没有";关键结论必须自己核实 |
| 提示上下文超长报错 | 输入超过窗口上限 | 调大 num_ctx(吃内存),或把长文档切分后再问,或换支持长上下文的模型 |
OLLAMA_FLASH_ATTENTION=1)用 8–14B 模型、Q4 量化、普通对话场景参考:
覆盖 2026-09-14 ~ 09-20(上周) 与 2026-09-21 ~ 09-27(本周,滚动更新至 09-22)。信息整理自公开报道与行业周报,具体数据请以官方公告为准。
全国网络安全标准化技术委员会在 2026 年国家网络安全宣传周开幕式发布该框架,针对智能体(Agent)、多模态等新形态提出更细化的安全要求,安全治理从"原则"走向"可落地条款"。
头部厂商负责人相继公开呼吁为前沿模型研发"踩刹车",叠加估值担忧,美股半导体指数当日暴跌约 6%,市值蒸发超 3000 亿美元,A 股算力板块同步分化。
英伟达、谷歌与 Emerald AI 联合成立全球首个 AI 能源管理联盟,推动数据中心按电网状况动态用电。同期行业共识转向:AI 扩张的瓶颈已从芯片转向电力。
华为全联接大会披露:昇腾超节点部署超 1000 套、昇腾 950 规模商用;并发布业界首个采用 NPO(近封装光学)技术的昇腾 960 超节点,单引擎传输容量 7.2T,直指集群"内存墙、功耗墙"。
智谱发布推理速度达 200 tokens/s 的新版本,同时公开国内首个 RSI(递归自我改进)工程化闭环——用模型自动设计并优化自身推理基础设施。同日完成约 156.83 亿港元 H 股配售,投向下一代模型与算力。
阿里达摩院 DAMO RADAR 可一次性识别 146 种病症并登上《Science》正刊,标志着多病种统一识别的通用医疗模型进入主流学术验证阶段。
美国地方层面出现明显趋严信号,要求最先进模型开发紧急关闭机制;与此同时联邦层面倾向"轻度监管",全球 AI 治理出现罕见的路线分歧。
阶跃星辰开源旗舰基座 Step 5 Preview,在全球开源榜单跻身前三;阿里千问开源图像生成模型 Qwen-Image-2.1,国产 GPU 厂商同日完成 Day 0 适配,实现"发布即适配"。
工信部在 2026 世界制造业大会上强调"大力发展开源基座模型和垂类模型";上海新增 12 款完成登记的生成式 AI 服务,累计达 236 款。开源+垂直行业成为国产落地的共同路径。
地瓜机器人完成 4 亿美元 C 轮(专注机器人芯片与软件平台);Crusoe 完成 39 亿美元 F 轮,投后估值 309 亿美元;瑞银将 2027 年全球 AI 资本支出预测上调至约 1.4 万亿美元,其中约九成增量来自内存涨价。
周度综述指出,本周行业呈现"模型轮动加速、算力门槛抬升、资本务实下沉"三大特征。算力硬基建(光互连、存储、先进封装)被视为中期确定性最强的方向,而前端模型厂商的商业化路径不确定性上升。
Grok 4.7 以远低于前沿旗舰的定价策略成为焦点,业内评价其为"便宜的第二种意见"而非替代方案——参数规模不再是唯一卖点,单位成本性能成为新战场。
据行业资讯汇编,DeepSeek V4.1-Flash 以 MIT 许可开放 1M 级上下文——对本地与自建部署者而言,这意味着长文档、代码库级别的处理能力可以用极低成本获得。
继 09.18 完成约 156.83 亿港元 H 股配售(另有周报提及新一轮大额融资,具体以公司公告为准)后,资金明确投向下一代 GLM 模型与自建算力基础设施,走"模型 + 算力"垂直一体化路线。
云服务商宣布自 10 月 1 日起上调 GPU 租赁费用(最新一代卡涨幅最高约 21%);韩国半导体零部件出现短缺,交付周期被拉长。对个人用户的直接影响是:云端成本上升,本地部署的性价比进一步提高。
编程、网络安全、金融投研是率先落地的场景;行业测算显示,若递归自我改进类技术常态化,大型模型的推理运维成本有望下降 30%–50%。Agent 的竞争焦点正从"能不能做"转向"做得多省"。
9 月以来旗舰模型密集发布,竞争焦点从"谁的分数高"转向"谁能自主完成任务",以及"谁的单位成本更低"。开源与闭源的差距已缩小到数月级别。
训练进入十万卡量级后,电力、散热、内存成为真正的约束。能源联盟、绿电直连、光电共封装等话题从"基建新闻"变成"行业主线"。
国内发布安全治理框架 3.0 并推进服务登记;海外则在"强监管"与"轻度监管"之间激烈博弈,甚至出现对头部厂商的反垄断诉讼。合规能力正成为企业选型的硬指标。
把常用地址集中在这里,点击按钮即可复制。
Ollama 官网 https://ollama.com Ollama 模型库 https://ollama.com/library LM Studio 官网 https://lmstudio.ai Open WebUI 官网 https://openwebui.com llama.cpp 仓库 https://github.com/ggml-org/llama.cpp vLLM 官方文档 https://docs.vllm.ai
Hugging Face 镜像 https://hf-mirror.com 魔搭 ModelScope https://modelscope.cn 硅基流动(免费额度) https://cloud.siliconflow.cn 智谱开放平台 https://open.bigmodel.cn 阿里云百炼 https://bailian.console.aliyun.com 火山方舟(豆包) https://console.volcengine.com/ark