从芯片到系统:MediaTek与NVIDIA合作的系统级设计变革

发布时间:2026/9/3 6:37:34
从芯片到系统:MediaTek与NVIDIA合作的系统级设计变革 近两年再看 AI 算力产业链有一个信号已经非常明显芯片公司不再只“卖芯片”了。NVIDIA 每一代旗舰硬件发布主角不再是一颗 GPU而是一套包含供电、散热、高速互联和管理软件的机柜系统。GDX 与 NVL 系列已经证明算力要变成可交付的产品必须完成从裸 Die 到系统的跨越。在这个背景下知名产业分析师郭明錤对 MediaTek 与 NVIDIA 深化合作的解读就特别值得注意。他的核心观点是AI 业务正在从芯片设计升级到系统级设计。换句话说联发科被寄予厚望的不再是“再设计一款手机 SoC”而是成为 AI 算力系统级设计链条里的关键角色。这篇文章不做简单的热点评论而是把“从芯片设计到系统级设计”这条线索拆开讲清楚三件事为什么产业会走到这一步系统级设计和传统芯片设计的差距到底在哪里以及这件事对做 AI 应用、做平台、做运维的工程师有什么实际影响。如果你正在部署 GPU 集群、开发端侧 AI 应用或者负责公司 AI 平台的驱动管理和算力规划这篇文章值得收藏备用。1. 为什么 MediaTek 与 NVIDIA 的合作值得关注1.1 算力产品的“最小交付单位”已经变了如果只看十年前的产品形态NVIDIA 的主业是卖显卡和计算卡用户买到的是板卡自己插进服务器。到了 DGX 时代NVIDIA 开始卖整机。再到 GB200 NVL72 时代交付的单位已经变成“整机柜”——一台机柜里把数十颗 GPU 组织成同一个高速互联域配套液冷、电源、管理网络和集群软件。这意味着一个根本性变化芯片设计的成败不再只由流片结果决定。一颗 GPU 性能再强如果放进机柜后出现供电不稳、散热不足、互连带宽不够、驱动和平台软件无法协同它就不能成为有效的算力。这就是“从芯片设计升级到系统级设计”的产业背景。GPU 公司、定制芯片公司、ODM 厂商都在往同一个方向走把芯片、封装、板卡、机柜、软件栈作为整体去做工程优化而不是一个个环节独立交付。1.2 公开能看到的几条合作线索MediaTek 与 NVIDIA 的合作并不是这一两年才开始的。梳理公开信息至少已经出现三类交集第一汽车智能座舱。MediaTek 将自己擅长的座舱 SoC 平台与 NVIDIA 的 GPU 加速技术结合用于车载 AI 座舱、多媒体与驾驶辅助等场景。这个合作里联发科主要负责系统集成和车规质量NVIDIA 提供 GPU IP和软件生态。第二面向端侧 AI 计算的芯片。NVIDIA 在 2025 年发布的 DGX Spark 个人 AI 超算中使用了 GB10 芯片。多家行业媒体报道指出MediaTek 深度参与了这颗芯片的定制设计。这件事的意义不仅是联发科“接了一个大活”而是它进入了 NVIDIA 的高端定制芯片供应链。第三分析师对 AI 服务器 ASIC 等方向的预测。目前更多停留在市场分析和行业讨论阶段没有完整官宣但方向已经能看出来联发科想从手机 SoC 向更高价值的 AI 定制芯片和系统级解决方案延伸。1.3 为什么郭明錤的解读有分量郭明錤是经常被产业界引用的分析师他的价值在于能通过供应链调研把公司的技术动作和产业趋势对应起来。他将 MediaTek 与 NVIDIA 的合作定义为“AI 业务从芯片设计升级到系统级设计”本质是在说联发科的角色已经不只是“IP 提供商”或“代工协调者”而是和 NVIDIA 一起做系统架构、做物理设计、做量产落地的深度合作方。这句话单独看好像是给联发科做业务定性放到整个 AI 产业链看其实是在提示一个转折点芯片行业最值钱的能力正从“能不能把电路画出来”变成“能不能把算力系统稳定地交到客户手里”。2. 芯片设计与系统级设计两个时代的技术边界2.1 先澄清一个容易混淆的地方“系统级设计”在芯片 EDA 圈子里还有一层学术含义通常指电子系统级设计偏向早期架构探索和软硬件协同仿真。但郭明錤这次谈的“系统级设计”显然不是 EDA 工具的某个流程阶段而是半导体公司的产品交付范围变大了。通俗地说芯片设计面向的对象是一颗 Die 或一个 SiP 封装。系统级设计面向的对象是一块板卡、一台服务器、一个机柜甚至一整条算力集群。芯片设计的核心指标是 PPAC即功耗、性能、面积、成本。系统级设计的核心指标多出了散热、互连、可靠性、可维护性、软件兼容性等一系列维度。所以这篇文章里的“系统级设计”指的是从工程价值链条上理解芯片只是系统的一个部件真正的产品是能跑 AI 负载的整机。2.2 一个尽量直观的类比做传统芯片设计有点像制造一台非常高端的仪器。你主要关心仪器本身的精度和功耗做完之后交给用户用户自己搭环境。做系统级设计则有点像建造一条生产线。除了核心设备你还要考虑供电线路、冷却系统、物料流转、故障报警、操作员培训和日常维护。设备很重要但整条线能不能稳定运行才是交付标准。AI 行业现在的情境是客户要的不是“这台仪器参数多好”而是“这条产线能不能一天 24 小时帮我跑出大量推理结果”。2.3 系统级设计与芯片设计的维度对比对比维度传统芯片设计AI 系统级设计设计对象Die、封装、IP 集成板卡、服务器、机柜、集群核心指标功耗、性能、面积、成本整机功率密度、散热、可用性、扩展性高速互联SerDes、片内总线、Die-to-DieNVLink、PCIe、RoCE、集群网络联合设计考虑时长主要到流片验证为止持续到部署后运维和迭代软件权重驱动、固件、中间件驱动、容器运行时、集群调度、全栈软件失败代价芯片返工整机柜无法上线、服务降级典型参与者芯片设计公司 Foundry芯片公司 ODM 云厂商 集成商2.4 系统级设计真正难在“末梢工程”很多人以为系统级设计就是“把多个芯片放一块板子上”难度只是规模变大。真正难的地方其实是那些看起来不够性感、却决定成败的末梢工程。以 NVIDIA 和 MediaTek 的合作场景为例。一颗 GB10 从设计到量产不是只保证芯片能跑基准测试就行。你要解决供电时序、信号完整性、固件启动、操作系统兼容、AI 模型库匹配等一系列问题。等它量产之后你又得面对不同厂家内存、不同主板、不同代际驱动之间的兼容矩阵。开发者和运维人员对这类问题一定不陌生。很多技术社区的高频问题比如“Ubuntu 安装 NVIDIA 驱动失败”“驱动版本存在已知问题”“D3D11 场景下要安装推荐驱动”本质上都不是某一颗芯片的问题而是整个系统没有把软件和硬件拧成一股绳。所以系统级设计能力越强的公司越能在交付前把这些“末梢问题”消化掉。用户感知到的就是开箱即用感知不到的是背后大量的兼容性验证。3. 为什么是 MediaTek手机 SoC 经验如何迁移到 AI 系统3.1 联发科最被低估的资产是“高集成设计能力”在消费电子行业MediaTek 一直以“集成度高、量产节奏快、成本控制好”著称。一颗 5G 手机 SoC往往要在很小的面积里把 CPU、GPU、NPU、ISP、5G Modem、内存控制器、多媒体模块全部集成在一起还要解决终端散热、续航、信号干扰、量产良率等工程问题。这种能力放进 AI 系统级设计来看价值非常直接有大规模量产经验适合做需要千万级出货的端侧芯片有复杂的 SoC 集成经验能扛住“多个 IP 协同工作”的系统复杂度有成熟的供电和低功耗设计能力适合做对功耗极其敏感的移动和车载平台与各类代工厂、封装厂、内存厂都有成熟的供应链协作流程。3.2 NVIDIA 真正缺的正好是这部分能力NVIDIA 的护城河很容易总结最先进的 GPU 架构、最完整的 CUDA 软件生态、最广的开发者覆盖。但如果在系统级设计的框架下看NVIDIA 不可能自己吃掉所有环节。它需要另一家公司来负责大型 SoC 的物理实现与量产工程需要一家熟悉 Arm 生态、能快速迭代且成本结构偏消费电子的合作方。而且 NVIDIA 要想进入汽车、AI PC 这样更高出货量、更短产品周期的市场就必须借助合作伙伴的整机工程能力。MediaTek 刚好缺一个从手机市场升级到 AI 高地的机会NVIDIA 刚好缺一个能帮它把高端系统级芯片落到地板上的人。双方合作的底层逻辑是互补。3.3 汽车座舱合作已经提前验证过一次汽车座舱是双方合作最好的样板。NVIDIA 的 GPU 和软件栈很强但车载座舱市场并不只需要一颗高端 GPU还要考虑车规认证、功耗范围、系统集成成本、交互生态。MediaTek 通过 Dimensity Auto 座舱平台把 NVIDIA GPU 的能力整合到面向汽车场景的 SoC 系统中。这个合作模式一旦在汽车市场走通就为更广阔的端侧 AI 和计算平台铺了路。很多分析师把 GB10 看作这种模式向 AI 计算设备延伸的一步逻辑上是自洽的。3.4 联发科想要的从“手机芯片大厂”变成“AI 系统级玩家”手机市场的增长已经到了平台期MediaTek 在 5G SoC 领域已经占据了不错的份额但继续向上的空间有限。AI 服务器、端侧 AI、智能汽车才是新的增长曲线。与 NVIDIA 加深合作能让 MediaTek 以更系统的身份进入这些市场。它在产品定义阶段就能参与而不是芯片设计完成后才去接单。这也是“AI 业务从芯片设计升级到系统级设计”对 MediaTek 自身定位的含义。4. 从卖芯片到卖系统AI 基础设施的商业模式重构4.1 商业价值正在从芯片向整机与服务转移过去很长一段时间芯片公司的商业模式比较清晰卖芯片按颗收钱。到了 AI 算力时代客户采购的不再是芯片本身而是“能够稳定运行大模型的算力”。所以你会看到 NVIDIA 推出 DGX 整机、机柜级方案、DGX Cloud 云服务也会看到它在不断强调“AI Factory”这一概念。把算力系统直接作为产品交付意味着芯片公司能够掌握更大的定价权和更高客户黏性。系统级设计不只是技术路径也是最直接的商业路径。4.2 系统级设计的竞争力不靠“堆硬件”在机柜级产品里几十张卡和几十颗芯片已经超出传统单板设计范畴。真正的竞争力在于算力能否被高速互联域完整组织起来整机功耗和散热设计能否支撑长期高负载固件、驱动、容器运行时、集群调度是否能无缝衔接故障发生时系统能否快速定位和自愈。这也是为什么 NVIDIA 要做类似 GPU Operator 这样的软件栈工具。它通过容器化和 Kubernetes 扩展把 GPU 驱动的安装、健康检查和生命周期管理变成平台能力。系统级设计里软件不是“芯片的辅助”而是“整机的操作系统”。4.3 产业链位置正在重新洗牌系统级设计兴起后产业链的角色不可避免要重新分配。芯片设计公司只提供公版 IP 和参考设计可能不够必须提供更完整的系统方案或与系统厂商深度合作。ODM/系统厂商不再是简单代工需要在上游芯片还没流片时就参与系统架构评估。云厂商和大型数据中心自研芯片和自研整机柜成为热门方向因为它们想掌握系统的最终优化权。MediaTek 与 NVIDIA 的合作是这种重新洗牌的一个缩影。未来会有更多类似组合出现一家擅长架构与算法一家擅长系统集成与量产联合做原本一家公司难以独立完成的大型平台。5. 这次升级对开发者和工程团队的实际影响5.1 AI 应用开发的“基础设施选项”会变多当芯片公司开始做系统级设计第一个受益的是应用开发者。典型例子是 DGX Spark 这类产品和各种 AI PC 的涌现。它们让开发者能在本地跑更大规模的模型减少对云端集群的依赖也让端侧 AI 产品的原型验证速度大幅提升。对做 AI 应用的人来说这意味着开发、调参、测试的反馈循环会缩短。MediaTek 这类公司在端侧 SoC 上的系统级能力还能带来更实际的终端体验AI Agent、多模态交互、端侧推理不再只是跑在云端而是越来越多落在手机、汽车、PC 的本地 NPU/GPU 上。5.2 驱动和运行环境的兼容问题会先变多再变少系统级设计的目标是让最终用户拿到“开箱即用”的整机。但在过渡期迭代速度越快兼容性问题反而会越突出。看技术社区近期的高频问题能明显感受到这一点“安装的 NVIDIA 图形驱动程序版本在 D3D11 中存在已知问题请安装推荐驱动版本”“Ubuntu 安装 NVIDIA 显卡驱动失败”“驱动卸载与安装反复折腾”“nvidia-smi 不显示 GPU”。这些问题都会随着系统级设计的完善逐步下降但今天做工程的人必须面临阵痛期。对平台工程师来说最现实的变化是不能再把“装驱动”当成一次性操作而是要当成持续的系统工程。5.3 异构计算会让软件栈更加复杂系统级设计并不只包含单一家 GPU。未来很多端侧设备会同时拥有 CPU、GPU、NPU甚至会混合使用来自不同供应商的计算单元。开发者的挑战在于同一套 AI 推理代码如何在不同算力单元之间自动分配。可以预期的方向是上层会变得更加框架化、抽象化。类似 PyTorch、ONNX Runtime 这样的中间层会吸收更多硬件适配工作而底层的芯片供应商会不断推出更多像 CUDA、TensorRT 这样偏系统级的工具链。5.4 直接调用 API 的开发者短期内感受不到变化这里要说句实话如果你只用云端 API 做大模型应用并不直接管理 GPU也不做本地推理优化那“系统级设计”和“芯片设计升级”对你就不会产生立竿见影的影响。它会先改变的是算力供给端的成本和形态再通过 API 价格、模型支持范围、推理速度间接传递到你手里。真正需要第一时间跟进系统级设计趋势的是做端侧产品、负责推理平台、做驱动和工具链的工程团队。6. 工程团队可以提前做的四项准备对于不负责芯片设计的工程师来说“系统级设计”听起来比较远。但它落到日常研发和运维里其实可以转化为非常具体的动作。6.1 建立可查询的 GPU 资产清单很多团队在出现 GPU 问题时第一反应就是重装驱动而不是先确认设备和驱动现状。一个简单的清单能帮你缩小排查范围。# 查看系统中有哪些 NVIDIA GPU lspci | grep -i nvidia # 查看当前驱动版本与显卡列表 nvidia-smi --query-gpuname,pci.bus_id,driver_version,memory.total --formatcsv执行之后你会得到类似这样的信息NVIDIA GeForce RTX 4090, 00000000:01:00.0, 550.54.14, 24564MiB NVIDIA A100-SXM4-40GB, 00000000:81:00.0, 550.54.14, 40960MiB建议把这部分信息统一记录到资产管理文档里。团队里任何人遇到问题先对照“硬件型号 驱动版本 CUDA 版本”三个字段能省掉很多无效沟通。6.2 为 NVIDIA 驱动建立“版本基线”驱动不是越新越好而是越匹配越好。系统级设计越深入软件栈的匹配问题就越重要。建议每个项目维护一个版本基线文件明确测试通过的组合环境项版本要求NVIDIA 驱动以官方推荐版本为准CUDA 版本与项目使用的深度学习框架对齐容器运行时nvidia-container-toolkit 版本操作系统内核在测试环境验证过的内核版本遇到驱动报错比如提示“存在已知问题请安装推荐的驱动版本”第一原则不是绕过问题而是先参照官方驱动搜索页推荐版本做降级或升级验证。修改前先在测试环境操作并在生产环境保留回滚方案。6.3 把 GPU 能力容器化无论 GPU 跑在物理机还是虚拟机里用容器隔离是更稳妥的思路。NVIDIA 官方提供 nvidia-container-toolkit可以让 Docker/Podman 容器直接访问宿主机 GPU。# 基础验证命令确认容器内可以看到 GPU docker run --rm --gpus all nvidia/cuda:12.4.1-base-ubuntu22.04 nvidia-smi注意不同 CUDA 版本需要对应镜像 tag请以实际项目和 Docker Hub 可用镜像为准。这条命令跑通后再进入真正的模型训练或推理部署环节你遇到“容器看不见 GPU”的概率会大幅下降。6.4 多卡环境要检查互联拓扑如果你的系统级准备涉及多卡 GPU 服务器一定要做互联拓扑检查。很多模型训练性能下降问题并不在单卡算力而在于跨卡通信路径不对。# 查看 GPU 互联拓扑 nvidia-smi topo -m # 查看 NVLink 连接状态 nvidia-smi nvlink -s拿到拓扑结果后你要确认两点一是 NVLink 是否全部连接成功二是训练任务分配到的 GPU 是否位于同一个高速互联域。如果两张卡跨了 PCIe SwitchP2P 通信性能会明显弱于 NVLink 直接连接。6.5 集群环境下引入自动化 GPU 管理Kubernetes 环境下手动逐台安装驱动已经很难维护。NVIDIA GPU Operator 这类方案的价值是通过 Operator 模式自动完成驱动、容器运行时、监控组件的部署与升级。# 查看集群节点是否已注册 NVIDIA GPU 资源 kubectl get nodes kubectl describe node node-name | grep -i nvidia在引入这类管理组件时请先在测试集群验证注意配置最小权限避免因为 operator 权限过大带来安全风险。生产集群的变更要提前备份并规划好回滚路径。7. 常见问题与排查思路系统级设计并不是一句口号最终还是要落到一个个具体问题的解决上。以下问题在 GPU 部署和 AI 开发中非常常见建议直接对照排查问题现象可能原因排查方式解决方案系统识别不到 GPU硬件接触不良或驱动未安装执行 lspci 确认硬件再执行 nvidia-smi重新插卡或安装匹配驱动驱动版本与新框架不兼容CUDA 版本与框架要求不匹配查看框架官方版本对照表在测试环境统一驱动和 CUDA 基线提示 D3D11 存在已知问题当前驱动版本存在已知缺陷查看官方驱动发行说明改用官方推荐驱动版本容器内 nvidia-smi 不可用缺少 nvidia-container-toolkit检查宿主机运行时配置安装并配置容器工具包训练时显存不足模型过大或显存碎片化使用 nvidia-smi 查看显存占用调整 batch size、开启梯度累积或换更大显存多卡通信速度慢GPU 不在同一 NVLink 域执行 nvidia-smi topo -m调整任务分配的 GPU 组合GPU 温度过高导致降频散热不足或功耗墙限制查看 nvidia-smi 的温度和时钟状态改善散热检查功耗配置驱动反复安装失败残留驱动未清理干净在安全模式下清理旧驱动文件用清理工具后重新安装官方驱动每一条建议都要以“最小影响、可以回滚”为原则。特别是生产环境不要在生产机器上做未经测试的驱动升级。8. 风险与不确定性分析师的判断不等于事实最后必须客观说明虽然“AI 业务从芯片设计升级到系统级设计”的方向非常清晰但郭明錤的解读属于产业分析不等于 MediaTek 与 NVIDIA 合作的全部细节已经确定。以下几个问题仍需持续观察第一合作产品是否落地。目前能够确认的是汽车座舱合作等公开项目。GB10、AI 服务器 ASIC、AI PC 芯片等方向很多还停留在行业报道和市场分析阶段需要等待官方正式产品发布和出货数据验证。第二系统级设计的执行周期。芯片设计周期本身要一到两年系统级设计还要叠加板卡、固件、量产和软件适配的时间。从战略方向到规模化收入之间可能隔着一到两个产品代际。第三竞争格局仍然复杂。擅长基础设施芯片设计的高通、博通以及加速自研和整机化的云厂商都在系统级设计方向上投入。MediaTek 能否把先发优势转化成长期份额仍有不确定性。所以一个更稳妥的判断是联发科和 NVIDIA 的深度合作证明系统级设计已成为 AI 算力产业的主流方向但具体谁能在三五年后获得更高市场份额要看后续产品矩阵和执行节奏。9. 本文小结与新思路从这里可以提炼出一个对工程师很有用的结论系统级设计不是半导体公司专属话题。它意味着你的每一个部署决策都应该把当前单机、单驱动、单 GPU 的局部视角放大到整个系统生命周期去考虑。具体动作也很明确看完本文后建议先在测试环境跑一遍 GPU 资产清单命令花半天时间整理团队当前的驱动版本和框架版本形成版本基线把容器化 GPU 验证方案纳入新项目初始化流程多卡环境务必做一次互连拓扑检查别等训练性能异常才想起来。产业分析师们关注的是谁能在未来几年定义算力系统的标准形态工程团队更该关注的是怎么跟着这个方向不断更新自己的部署、排障和系统设计方法。毕竟今天你做好的每一个版本基线明年可能就是你所在团队竞争力的基础。

相关新闻