Zhixiong Pan|2025年12月27日 15:01
今年的年度复盘,我请 AI Agent 协助,对自己做了一次基于数据的深度盘点。
分享这套流程,是因为它无需任何编程经验,就能让你轻松完成专业级的数据挖掘。
它甚至比 Vibe Coding 还要简单,只需要:全量数据 + Coding Agent。
为了验证这套流程的上限,我特意选取了个人数据中规模最大、结构最复杂的 10 年健康档案进行压力测试。
1️⃣ 数据规模与处理门槛
最终从苹果健康 App 导出的,是一份体积高达 3.5 GB 的 Apple Watch 中的健康相关原始数据。
这份文件中包含了几十万条心率记录,以及颗粒度极细的各类生理指标。
在 AI 介入之前,要处理这种规模的数据,我至少需要投入数天时间去研究 Python 库,并花费大量精力解析复杂的 XML 数据结构。
这往往也是很多人面对「量化自我」时最大的阻碍。
2️⃣ Agent 赋能的工作流
当我们引入 Coding Agent(如 OpenAI Codex 或 Claude Code)后,整个流程被彻底改变。
你不再需要关注具体的代码实现,只需明确「分析目标」。
Agent 会自动执行一个递归循环:自主研究数据结构 → 编写 Python 处理脚本 → 遇到异常结构 → 再次研究并修正代码。
它能独立完成从清洗到分析的全过程,帮我完成了许多之前因技术成本过高而搁置的设想。
如果不知道怎么下手,你可以先把任务的背景和对应的文件告诉它,让它自己进行一些探索,比如:
> 这是一份 Apple Health 导出的完整原始数据,请你看看里面包含了哪些类型的健康数据?时间跨度如何?
> 基于这些健康数据,帮我找 10 个 Insights。
> 基于不同类别的健康数据,请你帮我找找不同类别数据之间是否有相关性。
> 你确认你的研究正确吗,请你验证,并且给我更多中间数据,我来确认。
这些都可以很容易实现,甚至你可以进行更复杂更具体的研究。
⚠️ 注意:因为健康数据的原始数据规模比较大,是无法直接丢入 ChatGPT 等 App 中的,所以还是需要使用 cli 版本的 Coding Agent 来进行研究(Cursor 等 IDE 或许也可以)。
具体可以问 AI:
> 如何安装 Codex CLI / Claude Code CLI。
3️⃣ 样本概况
本次分析覆盖了从 2015年5月18日 至 2025年12月25日 的完整周期,共计 3875天。
在此期间,我佩戴过 5 款 Apple Watch,实际佩戴天数达到 3503 天,佩戴率超过 90%。其中最长连续佩戴纪录为 399 天,最长中断记录为 33 天。
4️⃣ 关键洞察:静息心率的相关性研究
基于清洗后的有效数据集,Agent 挖掘出了一些此前未曾发现的有趣规律。以下结论均由 Codex 计算得出(注:目前仅呈现相关性,非因果性):
🔊 环境噪音的即时压力(样本量:1802天):
环境噪音更高 → 当日静息心率偏高的概率增加 约 5.2 倍。
🪑 久坐的滞后影响(样本量:2546天):
站立时间更少 → 次日静息心率偏高的概率增加 约 1.75 倍。
🪜 攀爬的长期效益(样本量:1909天):
爬楼高度更少 → 次日静息心率偏高的概率增加 约 1.91 倍。
所以至少对我来说,环境更安静、每天工作时更常站起来、多爬楼梯,都可以带来长期的健康益处。
5️⃣ 实践与行动建议
目前的分析仅聚焦于静息心率这一维度,其中的算法细节和更多维度的交叉分析,后续有机会我会整理成详细的长文。
如果你也计划用 AI 进行此类分析,请注意,务必建立验证机制。
Agent 在处理复杂逻辑时可能存在「幻觉」,建议要求它输出中间统计数据,或者进行小样本的人工抽样核对,以确保最终结论的准确性。
或者用多个 Agent 进行交叉对比验证。
6️⃣ 总结
这仅是我个人对自己身体的一次数字化审视,结论未必严谨,仅作参考。
分享这一流程,意在展示 Coding Agent 如何抹平了技术鸿沟:挖掘数据资产不再需要会写代码,只需要会提问题。
既然技术门槛没了,不妨把那些积灰的数据翻出来,看看 AI 能帮你挖出点什么意料之外的细节。(Zhixiong Pan)
分享至:
熱門快訊
APP下載
X
Telegram
複製鏈接