本文发布于 2026-09-03 17:39从中央媒体到地方媒体,一场关于语料库的新“基建”正在展开。
5月,人民网发布“媒体语料服务平台”,提供从数据清洗、标注、预处理,到标准制定、安全流通、产权管理的一站式语料服务解决方案。
6月,新华社推出时政资讯智能体“新华语典”,其底座是新华社积累的权威数据,以及数千亿字的高质量语料库。
中央广播电视总台则把重点放在视听语料。其2025年发布的人工智能发展白皮书提出,在节目制播过程中同步完成海量视音频数据的清洗、分类和标签化,形成高质量多模态语料库,并以此支撑“央视听媒体大模型2.0”。
地方媒体也有入场。如四川日报报业集团建设“若水”省情语料库,将地方政务、历史图片等有四川特色的文化资源纳入其中。
媒体机构为何纷纷入局语料库?语料库会为AI时代的媒体行业带来哪些新机遇?中新社“庖丁解news”就此专访中央民族大学新闻与传播学院教授郭全中。

人民网“媒体语料服务平台”
什么是媒体语料库?
首先需要辨析几个容易混淆的概念:媒资库、语料库、高质量数据集。
传统媒体几十年的报纸稿件、照片、广播节目、电视节目,电子化之后被统一存放起来,就形成了媒体的媒资库。几乎每家媒体都有自己的媒资库,用于保存和检索资料。
但很多媒资只是完成了电子化,并没有真正完成数据化。
这些保存资料要想真正进入人工智能的内容生产体系,需要进一步清洗、分类、标注和结构化,把机器不能直接理解和高效利用的内容,变成机器能够学习的数据。经过这个过程,媒资库的内容才能逐渐进入语料库的范畴。如果继续发展,语料库还可以形成针对特定AI任务设计的高质量数据集。
“简单来说,媒资库,是媒体过去几十年积累下来的内容‘仓库’;语料库,是经过初步整理的数据原料;高质量数据集,则是为了训练AI进一步精加工的‘教材’。”
郭全中说,有了这套“教材”,媒体才能更好训练自己的垂类模型。而垂类模型要想真正形成差异化优势,背后必须有自己的专业语料库和高质量数据集。
争夺AI时代的能见度
第一层价值,是把沉睡的内容重新变成资产。
过去,一篇稿件发布出去,若传播生命周期结束,价值也基本结束,内容随之被存入档案系统。进入AI时代后,这些内容可以被重新清洗、标注和组织,成为人工智能模型可以反复调用的数据资产。
第二层价值,是为垂类大模型提供“燃料”。
豆包、DeepSeek等基础大模型一般擅长通识,垂类深度不足,媒体要打造时政、文化等垂类大模型,须用独家语料库进行微调。“否则所谓的垂类模型只是‘套壳’”,郭全中认为,主流媒体只有将几十年沉淀的媒资库数据化后注入模型训练,垂类大模型才能实现较好的效果。
第三层价值,是重新争夺AI时代的能见度。
过去媒体拼的是搜索结果排名、客户端下载量、社交平台流量,但现在越来越多用户直接向大模型提问,不再经过传统内容入口。郭全中表示,中央媒体建语料库,也是在通过数据供给掌握舆论定义权。高质量语料一旦被大模型预训练时“吃进去”,相关回答就会优先调用这些权威数据,主流信息的可见度自然大幅提升,这也是中央级媒体建设语料库的深层考量。
地方媒体的关键机会
郭全中认为,对于一些地方媒体来说,高质量语料库和AI数据集建设,很可能是完成系统性变革的“最后一次机会,也是最好的一次机会。”
但现实情况是很多规模较小的媒体机构、县级融媒体中心,本身可能没有足够多、足够独特的新闻媒资,该如何构建自己的语料库?
郭全中认为,地方媒体应该“跳出传媒看语料”。
例如地方的历史沿革、地方文化、旅游资源、产业资料、基层治理经验、政务服务信息等数据过去散落在不同部门、档案和数据库里。如果地方媒体能够参与其中,把它们加工成区域高质量数据集,那这些地方融媒体中心扮演的角色就不再只是“报道当地”,而可能成为地方数据的生产者、加工者和运营者。
这有望解决部分地方媒体长期面对的两个棘手问题。
一是传播能力不足。地方的一些高质量数据进入人工智能大模型之后,媒体的内容可以从“在自己的端内传播”,扩展到各种智能体和大模型场景。同时,当地方基于自己的语料库以及高质量数据集做出优质的垂类大模型后,也可以更好地为本地提供咨询与政务服务。
二是商业变现难。当前传统媒体行业,广告、发行等收入不断萎缩,而数据集建设做好了或可以提供数据加工服务,增加收入。更长期来看,如果媒体能够获得当地高质量数据集的持续运营能力,就可以基于数据开发政务、文旅、产业等垂类大模型和AI智能体。
“这些都有望大幅提升地方媒体机构的综合能力。”郭全中说。
观媒原创内容,未经授权不得转载、链接、转贴或以其他方式使用。本站其他转载内容,版权归原作者及出处所有。如有侵权,请联系我们进行删除。文章内容为作者个人观点,不代表观媒赞同其观点和对其真实性负责。本站只提供参考,不构成任何实际建议。