高通CEO暗示到2028年或将出现能够运行1000亿参数的大型语言模型

2026年10月11日 20:58 次阅读 稿源:cnBeta.COM 条评论

部分领先的人工智能企业正在推动手机行业开发能够持续运行1000亿参数大语言模型的设备,目标时间指向2028年。不过,这一设想面临两项现实挑战:一是运行如此庞大的模型需要大量内存,二是人工智能数据中心正在争夺全球内存产能,导致消费级内存供应紧张、价格持续上涨。

高通CEO阿蒙在接受Fireside Alpha采访时表示,一些处于人工智能行业前沿的企业正在探索能够持续运行千亿参数模型的手机。他没有透露这些企业的具体名称,但相关表态显示,人工智能公司对移动设备的期待正在发生变化:手机未来可能不再只是偶尔调用云端AI服务的终端,而是能够在本地持续运行大型模型、主动处理任务的个人计算设备。

不过,阿蒙的表态更多是在描述行业客户提出的目标,而不是高通已经正式公布的产品路线图。目前,高通尚未给出能够在2028年实现这一目标的完整硬件方案,也没有承诺届时一定会推出具备相应能力的商用手机。

从技术角度看,1000亿参数模型对手机硬件的要求远高于目前常见的端侧AI模型。大语言模型的参数决定了模型需要保存和调用的大量数值,而这些数据通常需要存放在内存中,以便处理器在推理过程中快速访问。

以一个拥有1000亿参数的模型为例,如果采用4位量化,每个参数理论上只需要4比特存储,那么仅模型参数本身就需要约50GB内存。实际运行时,还必须为操作系统、其他应用程序、上下文缓存以及推理过程中的临时数据预留空间,因此,50GB并不是一部手机能够顺畅运行该模型所需的完整内存容量。

如果进一步将模型量化至2位,每个参数只需要2比特,模型参数的理论存储需求可以下降至约25GB。但这种方案仍然要求手机拥有远超目前主流产品的内存容量,而且极低精度量化可能明显损害模型的输出质量,尤其是在复杂推理任务中。

需要说明的是,参数量并不能直接决定模型的全部能力。不同模型的训练数据、架构、训练方法和推理技术都会影响最终表现。一个经过优化的小模型,在特定任务上完全可能超过规模更大的模型。因此,即使手机暂时无法直接运行1000亿参数模型,也不意味着它无法提供接近大型模型的实际使用体验。

目前,智能手机的内存配置与千亿参数模型所需的容量之间仍存在明显差距。过去,部分Android旗舰手机曾经提供24GB LPDDR5X内存,但随着内存供应紧张、价格上涨,手机厂商开始重新评估高内存版本的商业价值。对于普通消费者而言,增加内存容量意味着更高的硬件成本,而手机厂商又很难确定,用户是否愿意为运行更大型的本地AI模型支付额外费用。

这就形成了一个矛盾:人工智能企业希望手机具备越来越强大的本地计算能力,但实现这一目标所需的内存,恰恰正在变得更加昂贵和难以获得。

全球内存供应紧张,与人工智能数据中心的快速扩张密切相关。大型科技公司持续投资AI服务器,需要大量DRAM、高带宽内存以及高速存储设备。内存制造商在安排生产时,也越来越重视需求旺盛、利润较高的人工智能相关产品,消费电子设备所需的传统内存因而承受供应压力。

虽然智能手机使用的低功耗DRAM与AI加速器使用的高带宽内存在产品结构和制造要求上有所区别,但它们仍然受到整个半导体产业产能分配和市场供需变化的影响。AI基础设施对内存的需求越强劲,消费电子厂商就越难在价格和供应量方面维持此前的条件。

这种压力已经反映在手机制造成本上。市场研究机构Counterpoint Research此前公布的分析显示,2026年第二季度,智能手机内存价格环比上涨超过80%。在不同价位的手机中,内存成本上升都对整机物料成本造成了显著影响。

Counterpoint指出,中端手机的物料清单成本同比增长约52%,内存占整体物料成本的比例达到约40%。高端手机同样受到冲击,DRAM甚至已经超过系统级芯片,成为部分旗舰手机中成本最高的单一组件。

这意味着,手机厂商不仅需要考虑是否有能力为千亿参数模型配置50GB甚至更多内存,还必须回答一个更现实的问题:消费者是否愿意为这些内存买单?

如果仅仅为了运行大型模型,就需要将手机内存从目前常见的12GB或16GB提升至64GB甚至更高,整机成本可能出现明显上涨。再加上更强大的处理器、先进封装以及散热设计,最终产品的价格可能进一步远离普通消费者能够接受的范围。

高通和苹果正在尝试从芯片架构与封装技术方面缓解这一问题。相关报道提到,苹果A20 Pro和高通新一代骁龙旗舰平台都在探索更有利于大型模型运行的芯片设计与内存组织方式,希望提高数据访问效率,并减少处理器与内存之间的数据传输开销。

不过,改善封装和数据访问效率,并不意味着物理内存需求会自动消失。即使处理器能够更高效地利用内存,1000亿参数模型本身仍然需要保存大量参数数据。要让这种规模的模型真正适应手机,行业可能还需要在模型压缩、推理架构和存储访问等方面取得进一步突破。

其中一种可能的解决方案,是更加激进的量化技术。通过降低每个参数所使用的比特数,模型可以在更小的内存空间中运行。不过,量化并非没有代价。对于需要复杂逻辑推理的任务,过低的数值精度可能导致模型性能明显下降。因此,如何在内存占用和模型质量之间取得平衡,将成为端侧AI的重要研究方向。

另一种方案是混合专家模型,也就是MoE架构。与每次推理都需要调用整个模型的传统密集型架构不同,MoE模型会根据具体任务选择部分专家网络参与计算。在适当设计的情况下,每次处理一个词元时,只需要激活模型中的一小部分参数。

如果进一步采用专家卸载技术,系统可以将当前需要使用的专家保留在DRAM中,而把暂时不需要的专家存放在闪存中。当推理过程需要其他专家时,再将相关数据从闪存读取到内存。

这种方式能够降低模型必须同时驻留在DRAM中的数据量,但代价是增加存储访问和数据传输开销。手机使用的UFS闪存,其访问速度和延迟特性与DRAM存在明显差异。如果模型频繁从闪存读取参数,推理速度就可能受到影响。

苹果此前也研究过利用设备内置存储运行大型语言模型的方案。这类技术有望降低对DRAM容量的依赖,但能否在手机上实现足够低的延迟、较高的吞吐量和可接受的能耗,仍然需要进一步验证。

此外,持续运行大型模型还会带来散热和续航问题。手机内部空间有限,无法像台式电脑或服务器那样配备大规模散热系统。如果处理器长时间进行高强度AI推理,芯片温度就可能不断上升,随后触发降频机制,导致性能下降。

对于需要全天候运行的智能体而言,这一问题尤其突出。传统聊天机器人通常在用户提出请求后才开始处理任务,而新一代AI智能体可能需要持续监控信息、分析上下文,并在适当时机主动执行操作。如果手机必须全天候运行大型模型,不仅内存需要始终保持可用,处理器的功耗和电池消耗也必须得到严格控制。

因此,即使未来的手机能够成功加载1000亿参数模型,也不意味着它就能以理想速度持续运行。模型是否能够真正驻留在内存中、每秒可以处理多少词元、运行过程中产生多少热量,以及对续航造成多大影响,都是衡量实际使用价值的重要指标。

相比直接将1000亿参数模型塞进手机,一种更加现实的方案可能是运行经过蒸馏和优化的中型模型。

模型蒸馏通常利用大型模型的能力训练较小的模型,使后者在参数规模明显缩小的情况下,尽可能保留大型模型在特定任务中的表现。Wccftech认为,经过适当蒸馏的200亿至300亿参数模型,在某些任务上有可能接近1000亿参数模型的表现,因此更适合成为未来智能手机本地AI的主力。

这种方案的优势在于,它不必依赖极端庞大的内存容量,就有机会提供相当强大的推理能力。对于手机厂商而言,与其单纯追求能够容纳多少参数,不如通过模型架构、量化、蒸馏和推理优化,在有限的硬件资源下实现更好的实际体验。

当然,不同模型之间的表现差异很大,200亿至300亿参数模型并不能在所有任务上取代1000亿参数模型。复杂推理、专业知识和长上下文处理等能力,仍然取决于具体模型的训练和架构设计。但从产品化角度看,能够在合理功耗和成本下完成大多数日常任务,可能比追求单纯的参数规模更有价值。

高通CEO此次表态,也反映出智能手机产业正在寻找新的增长方向。随着传统硬件升级的边际收益逐渐减小,手机厂商希望借助AI智能体重新定义设备的使用方式。

未来的智能手机可能不再只是等待用户打开应用、输入指令的设备,而是能够在用户授权的范围内持续理解需求、安排任务并调用不同服务的个人助手。这样的系统需要更强的本地推理能力,也需要更高效的内存管理、低功耗计算和安全机制。

不过,行业目标与最终产品之间仍然存在距离。阿蒙没有公布具体合作企业的名称,也没有提供完整的硬件路线图或量产时间表。2028年更适合理解为部分AI企业希望实现这一能力的目标时间,而不是高通已经确认的产品发布日期。

从目前的技术条件来看,手机在2028年运行千亿参数模型并非完全没有可能,但实现方式可能与人们想象中的“将完整模型全部装入手机内存”有所不同。更激进的量化、MoE架构、专家卸载、专用内存设计以及模型蒸馏,都可能成为实现目标的组成部分。

与此同时,全球内存供应和价格走势将直接影响这一方向的商业可行性。如果消费级DRAM供应长期受到AI数据中心挤压,那么即使技术上能够制造出拥有64GB甚至更高内存的手机,厂商也未必愿意大规模推出此类产品。

因此,高通提出的千亿参数手机愿景,真正需要解决的不只是芯片性能问题,而是模型规模、内存容量、制造成本、散热、续航和消费者需求之间的综合平衡。对于普通用户而言,未来最值得关注的或许不是手机能否运行一个参数达到1000亿的模型,而是它能否在不显著提高售价、不严重牺牲续航的前提下,提供可靠、快速且真正有用的本地AI服务。

对文章打分

高通CEO暗示到2028年或将出现能够运行1000亿参数的大型语言模型

1 (50%)
已有 条意见

    最新资讯

    加载中...

    编辑精选

    加载中...

    热门评论

      Top 10

      招聘

      created by ceallan