一、研究背景
中国地质大学(武汉)地球物理与空间信息学院长期开展地球物理、空间物理和空间信息技术研究。空间物理研究既关注电离层等地球系统圈层的形成与演化,也服务于无线电传播、卫星导航和空间环境监测等工程应用。
GNSS 掩星观测为研究电离层和中高层大气提供了重要数据。低轨卫星连续跟踪 GNSS 信号,切点随时间扫过不同高度,每个事件可形成一条具有时间、空间和物理属性的剖面,并进一步派生出 TEC、电子密度、闪烁等多层级产品。随着多星座并行观测和批量发射技术发展,掩星数据规模持续增长,部分业务星座每天可产生超过4.5万条观测廓线。
面对不断增长的观测资料,传统以 NetCDF 文件为中心的数据管理方式逐渐暴露出局限。科研人员需要在文件、星座、产品、版本和日期之间反复查找,才能定位目标数据;事件时间、发布时间和入库时间也需要严格区分。如何将分散文件组织为可查询、可追溯、可复现的科学数据资产,成为空间科学研究中的重要工程问题。
本次实践以 Apache IoTDB 为时序数据治理和查询验证工具,并进一步使用 TimechoAI 开展科学时序预测探索,尝试建立从数据整理到模型实验的可复用方法。
二、科学数据治理面临的挑战
海量文件中快速发现目标剖面较为困难
一条 GNSS 掩星剖面包含起止时间、空间范围、来源、处理流和物理观测值等多类信息。随着数据规模扩大,研究人员不仅需要找到某个文件,还要按照时间、空间、产品版本和质量条件筛选满足科学问题的数据对象。逐个打开文件的方式难以支撑跨年度研究。
多种时间和数据状态需要同时保留
观测事件发生时间、数据发布时间和入库时间具有不同含义。原始量、派生量、质量状态和算法版本也不能简单覆盖,否则后续研究难以判断数据来源和处理过程。数据治理必须在保留科学语义的同时,支持质量追溯和版本复现。
科学数据处理必须先验证正确性
空间科学数据对准确性和可复现性要求较高。数据从文件写入数据库的过程中,可能涉及时间转换、字段映射和重复提交等环节。系统需要支持写入状态记录、重复数据识别和逐点回读核验,先确认数据没有被错误转换,再开展查询和模型实验。
三、Apache IoTDB 数据治理实践
项目围绕“先发现对象,再读取明细”的思路,设计了 Profile—Point 两层数据模型。
podtc2_profile 用于记录一份文件或一条剖面的概要信息,包括文件名、数据来源、SHA-256 校验值、起止 UTC、空间包络、处理流、状态、算法版本和摘要。研究人员可以先通过这些信息筛选目标剖面,再根据 profile_key 获取对应的观测点数据。
podtc2_point 用于保存每一个观测点的详细内容,包括 S4、TEC、RFI、SNR、LEO/GNSS 几何坐标、源时间、GPS 秒、UTC、切点信息和质量位掩码。设备组织方式按照数据来源、产品名称、处理流、卫星、天线、GNSS 和弧段等信息构建,在控制实体数量的同时,保留不同观测链路之间的身份区别。
在数据写入流程中,项目同时保留 GPS 时间和 UTC 表达,使用 SHA-256 对原始文件进行校验,并通过 WRITING、COMMITTED 和 FAILED 等状态记录提交过程。对于重复提交的数据,系统能够识别并返回跳过结果,避免重复写入。
在一次真实 COSMIC-2 podTc2_nrt 文件验证中,原始文件包含1315个观测点,数据库回读结果同样为1315个点,逐点比较全部通过,文件来源校验也保持一致。这一实践首先证明了数据写入和回读过程的正确性,为后续科学查询提供了可信基础。
通过 Apache IoTDB 的组织和查询能力,项目已将约11年的持续观测资料整理为可查询的数据资产,整体规模约2000万份文件、约20亿个观测点。针对一个约4个月的目标时段,研究人员可以按照具体时间、空间和物理参数筛选约15万个目标观测点,并在分钟级获得查询结果。原本需要遍历大量文件的工作,被转化为一次可保存、可重复执行的科研查询。
四、TimechoAI 科学时序预测探索
在数据治理实践基础上,项目进一步使用 TimechoAI 开展科学时序预测实验,重点考察不同信息条件下模型对太阳活动和地磁变化的预测能力。
第一个实验以 F10.7 太阳活动指数为目标,只向模型提供起报时刻之前的历史序列,不额外提供太阳风或磁场等协变量,用于判断长期历史数据本身包含多少可预测结构。实验结果显示,模型能够跟随太阳活动周期的总体起伏,并形成可与传统方法比较的预测基线,但趋势预测并不等同于对太阳活动机制的解释,峰值、相位和极端误差仍需要独立评价。
第二个实验面向 Dst 地磁指数,在使用历史 Dst 数据的同时,引入 L1 位置卫星已经观测到的太阳风和磁场信息。由于这些数据在太阳风抵达地球磁层之前已经实际获得,因此属于起报时刻可用的未来协变量,并不构成数据泄漏。实验显示,加入上游驱动后,模型在强磁暴过程中的快速下降和恢复阶段表现出更好的响应能力。
这组实验形成了一个重要认识:预测信息越接近真实物理驱动,模型越有可能响应突发变化;但模型可信度不能只由单次结果判断,还需要遵守真实时间边界,采用滚动起报方式,并将平静期和极端事件分开评价。同时,TimechoAI 更适合作为快速建立预测基线和判断可预测结构的工具,最终结论仍应与持续性模型、统计模型和物理模型进行比较。
本次探索表明,Apache IoTDB 可以帮助科研人员将分散的观测文件转化为可发现、可核验、可复现的数据查询入口,TimechoAI 则在此基础上提供了快速开展科学时序预测实验的能力。未来,项目将继续探索观测数据、物理模型和时序预测的协同方式,为中高层大气风场等空间科学问题提供更可靠的研究支撑。