巨人天成
产经 科技 企业 数据 峰会 快讯 商业

超10万亿Tokens数据集炼成记:中国电信天翼AI如何构建AI发展基石

2025-09-26来源:快讯编辑:瑞雪

在人工智能浪潮席卷全球的当下,高质量数据已成为驱动行业发展的核心资源。中国电信天翼AI凭借其强大的数据基础设施,构建了超过10万亿tokens的通用大模型语料库,并打造了覆盖14个关键行业的专业数据集,总存储量达350TB。这些数据不仅体量庞大,更经过精心标注和优化,形成多模态、行业化的高质量数据资产,为AI模型训练提供了坚实基础。

高质量数据的价值在于其直接服务于AI模型开发。通过采集、清洗、标注等环节,原始数据被转化为可用的训练素材,显著提升模型的准确性、泛化性和实用性。中国电信天翼AI打造的星辰MaaS平台,正是这一过程的关键载体。该平台通过基模、数据工具链、模型工具链和智能体的协同运作,构建了“数据—模型—服务”的完整闭环,为行业提供从数据到应用的端到端解决方案。

星辰MaaS平台的核心优势在于其四大核心能力:基模作为“动力引擎”,提供基础认知与推理能力;数据工具链作为“原料库”,持续输送高质量数据;模型工具链作为“加工厂”,将数据转化为可用模型;智能体作为“执行中枢”,调度资源并完成复杂任务。基于这一体系,天翼AI不仅推进了大模型、智传网、具身智能等基础技术研发,更将技术转化为实际产品,服务于产业场景。

在技术落地方面,天翼AI已取得显著成果。其打造的“三全”星辰大模型体系——全模态、全尺寸、全国产,成功训练出万亿参数的大模型。该模型依托全国产的万卡集群和深度学习框架,在国产化创新领域走在前列。例如,在福建晋江的纺织厂中,基于星辰MaaS平台的AI验布系统取代了传统人工检测,实现了对并纬、擦伤、断经等10余种瑕疵的高效检出,检测准确率超95%,生产效率提升50%以上。

这一案例仅是天翼AI数据价值的冰山一角。从港口到供应链,从智慧医疗到现代农业,高质量数据正深度渗透至各行各业。中国电信天翼AI副总经理阮宜龙表示,公司重仓投入数据基础设施建设,源于对国家战略、市场需求、运营商优势和使命责任的综合考量。AI已上升为国家战略,而高质量数据是推动技术突破、实现普惠发展的关键。

在技术实现层面,星辰MaaS平台覆盖了数据全生命周期管理。其数据工具链支持文本、图片、音视频等多模态数据的统一接入和存储,通过上百种处理工具实现数据清洗、转换和增强。例如,在自动驾驶领域,平台利用AIGC技术生成极端天气和罕见事故的数据集,弥补现实数据采集的不足。模型工具链则支持40多种标注任务,通过AI预标注将效率提升5倍以上,降低标注成本。

对于高质量数据的定义,天翼AI认为需结合模型训练阶段和应用场景。基础大模型预训练数据集更关注规范性、完整性和安全性,而行业微调数据集则强调全面性、多样性和专有知识。以纺织缺陷检测为例,高质量数据集需覆盖20余种瑕疵类型,包含油污、水渍等多样形态,并精准标注瑕疵位置和类别。

在服务大型央企时,天翼AI针对其生产优化、系统复杂度高、安全和国产化要求等特点,提供端到端解决方案。例如,为物流集团构建的AI套件纳管超500P国产化算力卡,支撑流云大模型及CV模型研发,赋能全国智慧物流场景。在国家级数据标注基地建设中,天翼AI不仅提供技术平台,更扮演产业生态规划者、产能运营者和新职业培育者的角色,推动“算力供给-数据生产-模型训练-应用落地”生态链的形成。

目前,天翼AI的高质量数据集已在14个行业、30多个场景中落地。在医疗领域,与三甲医院合作构建的医疗质量管理数据集,推动医院运行管理智能化;在农业领域,为雄安新区打造的“雄小农”应用,帮助农民增收超15%;在政务服务领域,与深圳市政数局合作构建的民生诉求数据集,支撑25个智能应用场景。这些案例表明,高质量数据正从实验室走向产业一线,创造实际价值。

除数据和算法外,天翼AI还围绕数据治理、模型健壮性和应用可信性,自主研发星辰大模型安全围栏,防范意识形态和恶意利用风险。其推出的星辰系列大模型已完成双备案,并开源了国内领先的“全模态、全尺寸、全国产”模型。面向B端用户,提供18项API服务;面向C端用户,发布“智能反诈”应用和智能玩偶;面向家庭场景,推出AI智能眼镜,覆盖多场景需求。

中国电信天翼AI的最终愿景是成为国家战略科技力量和领先的通用人工智能服务提供商。为此,公司将在技术上追求领先,探索前沿领域;在应用上追求普惠,让AI走进千家万户;在生态上保持开放,支持全球开发者参与建设;在人才上实现研用一体,培养高层次AI队伍。作为AI国家队,天翼AI将持续强化赋能,打造高价值行业大模型,同时构建安全防护体系,确保数字经济红利全民共享。

上海工业博览会:中国电信展科技魅力,为工业数智化转型添动力
作为云网融合战略的先行者,中国电信在展台上勾勒出一幅覆盖底层网络、算力调度、虚拟化生产和智能运维的完整数智工业蓝图。 目前,视频AI巡检卫士已接入上海30余万路视频设备,实现了统一运维与管理,并在多个区的公…

2025-09-25

安徽大学岳阳王思亮团队:二维材料柔性储能与传感领域成果斐然
针对此问题,安徽大学岳阳/王思亮团队提出了梯度纳米限域MXene电极,通过多尺度层间距的精确调控结合面内介孔,实现了纵横离子传输的协同耦合。 这一系列工作不仅推动了MXene在储能和传感领域的发展,也为新型…

2025-09-25

宇树科技王兴兴:通用机器人发展遇阻,呼吁全行业协作共破技术瓶颈
9月24日,在高通2025年度骁龙峰会上,宇树科技创始人兼首席执行官王兴兴与高通公司研发副总裁兼全球AI研发负责人侯纪磊的现场对谈,就通用机器人的发展阶段、技术痛点、协作方向等议题,王兴兴发表了自己的观点。…

2025-09-25

2025骁龙峰会高通总裁安蒙:6G预商用设备或2028年大规模部署,速率等优势显著
2025年9月24日举办的2025骁龙峰会上,高通公司总裁兼CEO克里斯蒂亚诺·安蒙表示,最早在2028年,6G预商用设备就将实现大规模部署。 克里斯蒂亚诺·安蒙介绍称,6G将会成为云和端侧的连接,对比5G,…

2025-09-24

摩尔线程IPO加速,10家关联潜力股或迎机遇,深度梳理供研究参考
公司8月回复该项目正在积极推进中,双方的合作有望在国产算力生态构建方面发挥重要作用,推动国产GPU技术在更多领域的应用。和而泰主营业务为智能控制器研发与制造,是国家高新技术企业及A股上市公司。 润欣科技主营…

2025-09-24

网络信息繁杂难辨?优采云助力编辑高效产出优质原创内容
李编辑还借助优采云深度原创系统来生成文章,该系统以先进的AI作为底层支撑,凭借其独特的技术架构,能够依据不同的算法版本,精准且高效地生成具有高可读性的文章。李编辑借助这一功能,能够检测自己发布的文章是否原创…

2025-09-23

2025技嘉发布会亮点频现:从极限超频到AI算力,黑科技引领DIY新风潮
从能在活动现场创造两项世界超频纪录的钛冰雕主板,到可将AMD X3D处理器游戏性能再提升15%的X3D鸡血模式2.0,再到可自动对内存超频的技嘉D5黑科技2.0技术、惊艳的技嘉Stealth背插主板,以及为A…

2025-09-23

中国移动发布2025年AI泛终端白皮书:四大场景勾勒未来智能生活新图景
值得注意的是,所有AI终端产品均需满足统一的安全标准,接入AI能力时需提供大模型名称、备案号等信息,同时支持与中国移动终端智能体服务管理平台对接,轻量适配需支持至少一项九天大模型服务(如闲聊),完整适配则接…

2025-09-23

陕西移动西安分公司:4小时抢修护通信,5G-A赋能赛事展担当
U23亚洲杯预选赛期间,为保障现场3.3万球迷、工作人员及场外用户流畅的网络体验,西安移动首次在万人体育场部署5G–A创新技术,实现了智慧场馆通信保障能力的全面升级。 赛事期间,现场球迷真实地感受到了5G–…

2025-09-23

科大讯飞与中国移动共推AI速记 引领“AI+通信”新生态获赞
在2025中国移动产业投资生态合作伙伴大会上,科大讯飞与中国移动联合打造的“AI+5G新通话(1+X)ⁿ新生态模式”成为焦点。其中,双方共同推出的AI速记应用凭借创新技术与市场表现,获评产投协同十大标杆案例,标志着“AI+通信”领域协同创新迈入新阶段。

2025-09-23