AI 健身应用:从第一性原理到六个月可验证产品
这不是一份“功能越多越好”的清单,而是一套产品判断:哪些问题值得解决、AI 应该在哪里介入、哪里必须克制,以及小团队如何用真实留存和结果数据证明产品成立。
一页结论
不要做内容平台
Keep 已经证明内容、社区、硬件和商业化可以做得极广。小团队若从课程数量竞争,获客、版权和制作成本都会输。
不要做 AI 聊天壳
用户在深蹲组间不想聊天。他需要系统已经把下一组重量、次数、休息和替代动作算好,并允许一键接受或撤销。
做“下一步”
核心价值不是展示更多数据,而是把数据变成一个可信决定:今天练什么、下一组怎么做、计划为何改变。
建议的产品定义
“当我走进健身房,即使器械被占、状态波动或生活打乱,我也能在几秒内知道下一步怎么练;做完以后,系统能解释结果并可靠地更新下周计划。”
建议暂用工作名“动策”:面向中国规律力量训练者的、以结果为目标的自适应训练助手。它首先是一个极快的训练记录器,其次是一个透明的渐进超负荷与恢复决策引擎,最后才是对话式 AI。
产品护城河的顺序
训练中零摩擦
历史值、目标值、当前值同屏;预填、单手操作、离线、崩溃恢复、语音补录。没有这一层,任何 AI 都没有高质量数据。
可解释的调整
推荐必须写清“依据、变化、置信度、可撤销”。算法适应用户,而不是用户服从黑盒。
中国场景的闭环
商业健身房器械差异、中式混合餐、外卖与食堂、国产 Android 和健康平台,都是国际应用做不深的本地语境。
长期结果数据
真正的数据资产是“什么调整对什么人、在什么条件下有效”,不是聊天记录,也不是一个静态动作库。
六个月只做这些
- P0:计划导入/创建、组级记录、休息计时、上次表现、训练中替换、离线与恢复。
- P0:基于次数区间、RIR/RPE、近期表现和疲劳信号的下一组/下一次建议;每条建议可解释、可覆盖。
- P0:周复盘只给最多三个决定:加重量、减量/减载、维持或换动作。
- P1-light:体重趋势、蛋白质下限、热量方向和三档饮食记录;不自建“百万食物库”。
- 内容:先做 60 个高频动作与清晰替代关系,不做“全动作百科”。
范围与方法
本研究把公开证据分成四类:官方产品页/应用商店功能,企业披露,同行评审研究,以及应用商店用户评论。前两类能说明产品实际主张与战略,研究用于确定技术和健康建议边界,评论仅用于发现高频问题线索,不能当作总体用户比例。
已回答
- 健身房和居家训练的关键任务与摩擦
- 训练、饮食、动作库的刚需等级
- 国内外代表性竞品的强项与缺口
- AI/LLM/CV 应放在哪一层
- 六个月 MVP、指标、定价与停止条件
尚未被桌面研究证明
- 中国规律训练者的付费意愿分布
- 推荐解释能否显著提高采纳率
- 中式混合餐快速记录的真实留存增益
- 目标人群的第 8 周留存与长期训练结果
- 各国产健康平台可稳定取得的数据范围
事实Keep 在 2025 年年报中将战略表述为从内容平台走向 AI 驱动生态,并披露多智能体、主动教练、自定义计划、语音跑步与食物图片分析等使用数据;这是公司口径,但足以说明“大而全 + AI”赛道已有强者。[10]
推断因此“比 Keep 多一个 AI 计划”不是差异化。研究重点应转向现有产品不愿或难以优化的高频窄场景:组间 30–180 秒内的决策、计划调整的透明度、数据可靠性与本地器械/饮食环境。
从结果倒推产品,而不是从功能正推
这是一个乘法系统:计划再科学,若用户无法持续执行,结果仍接近零;记录再完整,若不能改变下一个决定,数据价值也接近零。对产品而言,价值可以进一步写成:
五个不可回避的问题
一项功能只有在帮助用户更好地回答以下至少一个问题时,才有资格进入核心产品:
- 今天练什么?目标、周期、可用时间和器械决定今天的刺激。
- 下一组做多少?重量、次数、RIR/RPE、休息和技术状态决定即时负荷。
- 现实变了怎么办?器械被占、出差、疼痛、睡眠差和漏练都需要低成本重排。
- 训练有效吗?用户需要看趋势、停滞和原因,而不是更多图表。
- 训练之外要改什么?只在营养、体重趋势或恢复确实限制目标时提出下一步。
科学原则应该变成“有边界的引擎”
事实ACSM 的阻力训练进阶立场强调,负荷、容量、频率和休息要随目标与训练水平变化;其中一种进阶规则是在用户连续超出目标次数时逐步增加负荷。[1] RIR/RPE 可帮助调节当日负荷,但原始证据来自有限动作与样本,并不等于对每个人都精确。[2]
推断产品不应输出“唯一正确重量”,而应给出一个受约束的候选值、依据和不确定性。用户的覆盖行为是训练数据,不是“错误”。
组级表现、RIR、体重趋势、疼痛、时间与器械
区分随机波动、疲劳、计划问题与执行问题
下一组、下一练、下周只改变必要变量
一键接受、语音记录、替换、离线完成
比较建议、实际选择和后续结果,更新个体模型
先服务谁:规律训练者,而不是“所有想变健康的人”
| 人群 | 最强任务 | 现有替代 | 产品机会 | 首发建议 |
|---|---|---|---|---|
| 健身房新手 | 不会选动作、不会判断动作是否安全 | Keep 课程、私教、短视频 | 引导与动作教育大,但责任和内容成本也高 | 第二阶段 |
| 规律力量训练者 | 稳定进步、少思考、应对器械和状态变化 | 纸笔、表格、训记、Strong/Hevy、教练 | 记录频率高、历史数据有价值,且透明决策仍弱 | 首发 |
| 高级训练者 | 完全自定义、周期控制、深度数据 | 表格、RP、Alpha、教练 | 愿意提供数据但容忍度低,会挑战算法 | 共同设计者 |
| 居家训练者 | 低器械、短时间、坚持与动作跟练 | Keep、Freeletics、视频平台 | 语音/视觉引导明显,但内容与获客竞争激烈 | 不与首发混做 |
| 减脂主导用户 | 饮食执行、体重趋势、情绪与生活约束 | 薄荷、MyFitnessPal、MacroFactor | 营养价值高,但会把团队拉进另一套数据与行为问题 | 训练用户的可选模式 |
滩头用户画像
纳入
- 每周力量训练 2–5 次,已持续至少 8 周
- 知道基础动作,但不一定懂编程
- 正在记录,或因麻烦/无反馈放弃过记录
- 目标为增肌、力量或减脂保肌
- 主要使用商业健身房,Android 优先
暂不纳入
- 术后康复、疾病处方、孕产等医疗场景
- 完全依赖视频跟练的零基础用户
- 专项竞技备赛与药物相关建议
- 需要实时多人课程或教练工作室 SaaS
- 只想获得食谱、买课或社交打卡的人
建议居家训练不是删掉,而是作为同一引擎的另一种“器械配置”在验证核心闭环后扩展。首发同时做健身房和居家,会迫使动作内容、交互、获客话术和成功指标全部分叉。
真正的痛点发生在一整条训练旅程里
| 时刻 | 用户脑中的问题 | 当前摩擦 | 机会 |
|---|---|---|---|
| 训练前 | 今天练什么?状态差要不要改? | 计划静态;应用只展示清单;用户自己猜 | 30 秒状态检查 + 有理由的最小调整 |
| 热身 | 热身组怎么上?今天重量是否合适? | 热身方案散落在笔记;算法很少观察热身表现 | 按工作重量自动预填;异常表现触发保守调整 |
| 组间 | 刚做了多少?下一组加不加?休多久? | 湿手、手套、单手、注意力分散;多次点击和键盘中断节奏 | 上次/目标/本次同屏;一键确认;语音补录;自动计时 |
| 器械被占 | 换什么才等价?换了以后重量怎么算? | 普通动作库只列动作,不理解刺激、技术与器械差异 | 按肌群、动作模式、稳定性、负荷曲线和个人历史替代 |
| 训练结束 | 今天好还是不好?下次要改什么? | 总容量与 PR 不能解释疲劳或技术妥协 | 仅总结偏差与下一次变化,不做数据烟花 |
| 一周后 | 我是否真的进步?为何卡住? | 图表很多,行动建议很少;或 AI 无理由重写计划 | 稳定基线 + 一次改变一个变量 + 版本记录 |
| 生活打断 | 漏练、出差、只有 30 分钟怎么办? | “未完成”被当失败;计划整体失效 | 保留优先动作与周刺激,压缩/顺延/重排 |
| 饮食 | 今天吃得是否足以支持目标? | 称重太累,拍照又假装精确;中式混合餐、油量和份量难判断 | 三档精度、可编辑拆分、区间和趋势反馈 |
评论证据揭示的不是“缺功能”,而是“失去控制”
评论线索Fitbod 的评论既肯定“无需思考今天练什么”、器械配置和动作替换,也抱怨训练开始后导航受限、Watch 同步/冻结、AI 在编辑时插入逻辑,以及缺少针对受限动作和技术问题的反馈。[31]
评论线索训记的精选评论集中在“何时加重量/平台期怎么办”、训练中需要直接比较上次表现、计时和录入多一步、食物自定义与排序等;Keep 评论则出现界面拥挤、关键数据层级变深、训练中看屏幕不安全,以及对热量估算可信度的疑虑。[11][32]
推断用户并不排斥算法;他们排斥的是算法在错误时刻夺走控制、不给原因、不能撤销,或因为同步/导航失败破坏了训练主任务。
痛点优先级
决策不确定
“今天/下一组到底做什么”比“有没有更多动作”更频繁、更接近结果。
记录摩擦
没有连续、可信的行为数据,个性化只能退化成问卷标签。
现实变化
好计划不是从不变化,而是在器械、时间、恢复变化时仍保住关键刺激。
反馈不可行动
PR、容量和热量都是中间指标;用户需要下一个最小改变。
信任与安全
黑盒推荐、伪精确营养和泛化姿态纠错会迅速消耗信任。
哪些是刚需,哪些只是看起来完整
| 功能 | 等级 | 为什么 | 首版边界 |
|---|---|---|---|
| 训练计划与组级记录 | 通用刚需 | 承载执行与后续判断,是纵向数据源 | 预填、复制上次、单手、离线、崩溃恢复 |
| 训练中“下一步”建议 | 核心刚需 | 直接降低认知负担并改变结果 | 重量/次数/RIR/休息;理由与撤销 |
| 计划自适应 | 核心刚需 | 静态计划无法处理疲劳、漏练与现实器械 | 只做小步调整,不每天重写 |
| 进步诊断 | 核心刚需 | 用户想知道是否有效以及下一步,不只是看图 | 周复盘最多三条动作 |
| 动作替代与器械配置 | 场景刚需 | 商业健身房最常见的中断之一 | 先覆盖高频动作和明确替代关系 |
| 动作示范与关键提示 | 上下文刚需 | 使用时有价值,脱离计划的“大百科”使用频率低 | 真实视频 + 三个提示 + 常见错误 + 替代 |
| 体重/围度/照片趋势 | 目标刚需 | 训练表现不等于体成分结果 | 趋势优先,不用单日波动做决策 |
| 完整饮食记录 | 条件刚需 | 减脂/增重阶段很重要,维持期未必值得每日成本 | 精确、快速、最低三种模式 |
| 固定餐单与菜谱 | 可选工具 | 能降低决策,但与外卖、食堂、家庭饮食冲突 | 给“模板与替换”,不要求照表吃 |
| 完整动作/器械大全 | 非刚需 | 广度容易复制,质量难维护;不直接解决下一步 | 60 个高频动作比 1000 个低质量条目更好 |
| AI 聊天 | 交互方式 | 聊天不是用户目标;高频场景甚至更慢 | 用于异常、解释和自然语言录入 |
| 社交、勋章、商城 | 非首版 | 可能促活或变现,但稀释核心任务 | 只保留可选择的轻量问责/分享 |
市场不是一个赛道,而是六种价值主张
| 类别 | 代表产品 | 用户购买的价值 | 典型缺口 |
|---|---|---|---|
| 记录器 | Strong、Hevy、训记、GymStreak | 快速、稳定、历史、统计 | 记录后仍需用户自己编程与诊断 |
| 算法训练 | Fitbod、Alpha Progression、RP Hypertrophy | 少思考、自动负荷/容量与计划 | 黑盒、泛化、用户失控或目标过窄 |
| 计划市场 | Boostcamp | 可信教练计划 + 自动进阶 + 记录 | 计划选择仍复杂,跨计划的个体学习弱 |
| 营养记录/教练 | MacroFactor、MyFitnessPal、Cronometer、薄荷 | 食物数据库、目标、趋势与调整 | 力量训练决策层薄,中文混合餐精度难 |
| 内容与综合生态 | Keep、Freeletics、硬汗 | 课程、跟练、内容、广覆盖 | 功能密度高;严肃训练的组级反馈不够深 |
| 人类教练平台 | Caliber、Trainerize | 问责、解释、视频反馈与关系 | 贵、难规模化;需要教练供给 |
| 综合 AI agent | Cora、Zing | 训练、营养、睡眠、日程联动 | 承诺广、证据和控制感不足;本地化弱 |
推断功能已经高度商品化:计划生成、动作库、拍照识餐、聊天和简单恢复分数都能被快速复制。市场仍缺的是同一套纵向状态模型把这些输入变成少量、可追溯的训练决定。
竞品逐类拆解:该学什么,不该复制什么
中国市场
| 产品 | 当前强项 | 暴露出的不足 | 应吸收的设计原则 |
|---|---|---|---|
| Keep | 课程、品牌、社区、硬件与 AI 生态;应用描述已覆盖健身房记录、饮食拍照、吃练睡洞察和 AI 教练。[9] | 广度带来信息架构负担;评论中出现关键数据难找、训练中需看屏幕、热量估算信任等问题。[32] | 不争“最多内容”;把训练会话从生态噪音中彻底隔离。 |
| 训记 | 中国严肃力量训练记录心智强;已有计划、容量分析、动作库、Watch。2026 版本记录显示其正加入食物扫描/语音、TDEE、智能计划与 Agent 数据接口。[11] | 评论仍在问何时加重量、平台期和实时对比;这说明“有数据”不等于“有决定”。 | 它是最直接的中国竞品;必须在解释性自动进阶和训练中效率上出现可感知代差。 |
| 薄荷健康 | 中文食物数据、减重心智、AI 拍照/语音、体重饮食睡眠与教练。[12] | 核心仍是体重管理;严肃力量训练的动作、进阶和组级反馈不是主战场。 | 营养层应合作/接入/导入,而不是六个月复制其数据库。 |
| 硬汗健身 | 器械与居家场景、问卷生成计划、动作内容,定位容易理解。[13] | 用户评论出现强付费墙、订阅体验和不现实转化预期等线索;算法差异不透明。 | 价值先于付费墙;避免“21 天改造”式承诺。 |
全球市场
| 产品 | 最值得学 | 仍未解决 |
|---|---|---|
| Strong / Hevy | 把组级记录、模板、计时、历史、RPE、盘片计算和社交做得成熟;Hevy 还以训练社交和复制计划形成网络效应。[14][15] | 默认用户能自己决定计划与调整;高级统计仍不自动等于建议。 |
| Fitbod | 用近期历史、肌群恢复、器械、目标和偏好生成训练;替换动作和器械 profile 很实用。[16] | “每天新鲜”可能破坏稳定基线;评论出现编辑控制、Watch 同步与受限动作处理问题。[31] |
| Alpha Progression | 给到下一组重量、次数与 RIR;计划相对稳定,并包含周期和减载。[17] | 对生活约束、营养与跨平台数据闭环覆盖有限;强项容易被本地产品复制。 |
| RP Hypertrophy | 用泵感、酸痛、负荷感受反馈调整增肌容量,形成明确的周反馈闭环。[19] | 聚焦增肌,输入和方法体系对大众偏重;不适合所有目标。 |
| Boostcamp | 可信教练计划库与记录器结合,降低“算法凭什么”的信任门槛。[18] | 计划资产强,但对同一用户跨计划的长期响应学习不一定是核心。 |
| MacroFactor | 用摄入记录和体重趋势反推个体消耗,按周调整;坚持中立、不因“超标”羞辱用户。[20] | 营养闭环极强,但力量训练过去不是核心;中国食物和平台生态不占优。 |
| MyFitnessPal / Cronometer | 前者数据库与生态广,后者验证食物和微量营养深。[22][23] | 数据广不等于对力量训练者的最小可行动反馈。 |
| Eat This Much | 根据目标、偏好、预算与日程自动排餐,并能替换与生成采购清单。[24] | 计划容易与真实社交饮食、食堂和外卖脱节;遵循成本高。 |
| Zing / Freeletics | 把 AI 个性化、日程与家庭/健身房场景包装成教练体验。[25][26] | Zing 评论中出现用户期待全程动作跟踪、实际相机能力有限,以及计划难度不当的落差;说明“AI”标签会抬高预期。 |
| Caliber / Trainerize | 人类教练的视频反馈、日常消息、周复盘,以及训练/营养/习惯管理。[27][28] | 关系和判断质量强,但成本、供给和一致性限制规模。 |
| Cora | 最接近未来形态:训练、营养、睡眠、恢复和日程共同驱动,用户可在应用或文本中记录,生活变化后主动调整。[29] | 广而新的 agent 产品仍要证明长期效果、控制感和安全;iOS/Apple Health 优先,也留下中国 Android 的空间。 |
注:产品人数、评分、食物/动作数量等若来自厂商或应用商店,仅代表其公开主张,不视为独立审计结果;动态价格与功能会变化。
竞品的六个结构性缺口
“记录”和“教练”分裂
记录器保留控制但不下判断;AI 教练下判断但缺少可审计的组级数据。机会是让每个决定都回到原始记录。
推荐在黑盒里
很多产品展示结果,不展示“因哪三条数据、改了哪个变量、没改什么”。一旦建议不合适,用户只能全盘接受或离开。
把变化误当个性化
每天换训练看起来智能,却减少可比性和技术练习。更好的个性化是稳定框架内的必要调整。
输入精度与反馈精度不匹配
一张中式餐照片无法可靠看出用油和份量,却常输出个位数千卡;手表能量消耗也不应被当成精确摄入预算。消费级腕戴设备研究显示心率与能量消耗的准确性并不等价。[4]
训练当下仍像“填表”
同步失败、多层导航、键盘、不能离开训练页、不可撤销自动化,都会在最需要专注时制造摩擦。
健康信号缺少信任治理
疼痛、体重、照片、睡眠和生理数据高度敏感;多数产品把隐私当条款,而不是产品能力。
产品战略:稳定计划里的主动协助
定位句
建议对于已经规律训练、但不想自己维护表格和猜测进阶的中国健身房用户,“动策”是一个训练中几乎不打扰、训练后能解释并自动更新计划的力量训练系统。
四条不可妥协的产品原则
先行动,后聊天
默认给可执行卡片;只有异常、解释和补充输入才进入对话。AI 不是首页上的输入框。
稳定优于新奇
计划保留数周基线,只有证据达到阈值才改变;变化必须可回看、可撤销。
承认不确定
营养给区间,恢复给信号而非真相,视觉模型不确定时放弃判断,疼痛进入安全分流。
用户拥有数据
可导入、导出、删除;训练中离线可用;自动化永远允许覆盖。
信息架构
| 一级入口 | 核心内容 | 刻意不放 |
|---|---|---|
| 今天 | 今日训练、准备度、最近趋势、最多一条恢复/营养提醒 | 资讯流、广告、商城 |
| 训练 | 正在进行的会话、计划、历史与导入 | 社区动态 |
| 进展 | 力量趋势、执行率、体重/围度与周复盘 | 无法行动的几十张图 |
| 动作 | 高频动作、个人器械、替代关系和技术提示 | 未经审核的 UGC 教程 |
| 我的 | 目标、限制、数据权限、导入导出、算法与隐私控制 | 强制社交身份 |
六个关键界面,而不是六十个功能页
01 · 今天
首屏答案:“上肢 A,预计 52 分钟;卧推维持 75 kg,因为上次达到次数但 RIR 低于目标。”
- 状态检查只问会改变计划的变量:可用时间、异常疼痛、极端疲劳。
- 睡眠/心率数据若可得只作背景,不强迫每日主观问卷。
- “按原计划”“保守版”“30 分钟版”三选一。
02 · 训练中
一屏一件事:动作、上次、目标、本次、计时器。
- 预填重量与次数;点一次完成,长按修改,滑动撤销。
- 语音:“七十五公斤八次,还能两次”解析为结构化记录,并立即回读确认。
- 所有写入先本地完成;网络不稳定不影响训练。
03 · 快速替换
点击“器械被占/不舒服/不想做”,候选动作按刺激接近度、个人熟悉度、当前器械和历史负荷排序,并自动换算起始建议。
不能只按“同一肌群”替换;自由重量卧推与器械推胸的稳定需求、技术与负荷不可直接等同。
04 · 训练结束
只展示三件事:完成了什么、哪里偏离、下次会改变什么。让用户确认“系统理解得对不对”,而不是庆祝动画占满屏。
05 · 周复盘
最多三张决策卡:例如“卧推 +2.5 kg”“腿举本周维持”“下周总组数 -2”。每张卡可展开依据、查看反事实、接受、修改或跳过。
06 · 营养与恢复
不是第二个 MyFitnessPal。默认显示体重趋势、蛋白质完成范围、热量方向和一个下一步;精确记录仅在用户进入明确增/减重周期时开启。
训练决策引擎:小步、透明、可回退
引擎需要的最少数据
稳定画像
目标、训练经验、可用天数、常用器械、动作限制、单位与偏好。
训练事件
动作、负荷、次数、组型、RIR/RPE、休息、完成/跳过、替换与原因。
结果与约束
体重趋势、围度、疼痛、极端疲劳、可用时间;可穿戴只是可选背景。
首版只实现三种可审计进阶
| 模式 | 适用 | 示例规则 | 为什么首版可控 |
|---|---|---|---|
| 双进阶 | 多数固定动作 | 先在目标次数区间内增加次数;连续达到上限且 RIR 在目标范围,再加最小可用重量 | 用户易理解、易验证、与器械最小配重兼容 |
| RIR 自动调节 | 当天状态波动 | 若实际 RIR 明显低于目标,下一组保守降重/降次数;反之小幅增加 | 只改当前负荷,不重写整个计划 |
| Top set + back-off | 有经验、主项稳定者 | 用顶组表现估算当天能力,再计算回退组;低置信度时保持上次值 | 能兼顾强度与状态,但仅开放给有足够历史的用户 |
这些是产品规则示意,不是面向个人的训练处方。实际阈值需由教练审核,并通过真实数据按动作、器械和训练水平校准。
决策顺序
- 硬约束先行:疼痛红旗、器械不可用、计划总时长、用户禁用动作。
- 判断数据够不够:历史不足或记录异常时,不生成“个性化”精确数值。
- 生成有限候选:保持、加量、减量、替换;每次尽量只改变一个变量。
- 规则与个体响应排序:比较最近 2–4 次同动作/同模式表现及恢复。
- 输出解释:证据、变化、置信度、风险与替代方案。
- 采集覆盖原因:太重、器械、疼痛、时间、偏好;用结果而非服从度训练模型。
AI 应该是翻译器与排序器,不是无边界处方者
研究边界一项针对 26 类临床人群的研究发现,通用聊天模型给出的运动建议中,已提供内容多数准确,但完整性只有约 41%,且可读性偏高;后续范围综述也强调目前仍应作为专家补充而非替代。[33][34]
推断LLM 可把“今天胸没状态,史密斯还被占了”解析成约束,也能把结构化决策解释成人话;但它不应独立计算训练负荷或自由生成伤病建议。
各技术的正确职责
| 技术 | 适合 | 不适合 | 上线门槛 |
|---|---|---|---|
| LLM | 语音/文本结构化、解释、周总结、异常追问 | 直接、不受约束地制定负荷和伤病判断 | schema 校验、引用依据、红队测试、回退模板 |
| 规则引擎 | 进阶、变化幅度、硬约束、安全分流 | 处理含糊自然语言和长尾表达 | 教练审核、单元测试、版本化、可重放 |
| 个体响应模型 | 从纵向数据估计什么调整更可能有效 | 冷启动时假装精确 | 基线比较、置信区间、分群公平性与漂移监控 |
| 计算机视觉 | 有限动作的计次、节奏、明显活动范围;拍照拆分候选食物 | 单相机对所有动作做伤病诊断和“标准姿势”裁决 | 固定动作逐个验证、拍摄质量门、低置信度主动放弃 |
| 可穿戴数据 | 训练时长、心率背景、睡眠趋势与会话同步 | 用当天消耗数字精确决定进食 | 来源透明、可关闭、缺失时不降级核心体验 |
Android 首发的务实路径
Health Connect 已定义训练会话、计划训练、营养、睡眠、体重等数据类型和细粒度权限,可作为兼容层之一。[8]但中国设备生态不能假设只靠一个接口:首版应把核心训练日志完全掌握在应用本地数据库中,把平台同步做成可插拔适配器,并逐家验证厂商行为。
建议移动端采用 local-first:写入立即成功、后台增量同步、事件去重与冲突合并;服务端保存规则版本和建议快照,使任何一次推荐都能重放。LLM 调用异步化,训练主流程在模型不可用时仍完整工作。
饮食要做,但应该做成“可选择的精度”
研究边界2025 年一项系统综述纳入 13 项 AI 饮食评估研究;多数仍处于前临床场景,研究间相关性跨度大,且多数存在中等偏倚风险。结论是有潜力,但仍需更大、更广泛人群验证。[3]
竞品启发MacroFactor 的 AI food logging 不把聊天感作为卖点,而是把一句话或照片拆成可编辑食材,再落到结构化食物库;其公开说明也明确 AI 会出错。[21]这是比“拍照即得到精确热量”更可信的交互。
三档记录模式
| 模式 | 用户成本 | 输入 | 反馈 | 适合 |
|---|---|---|---|---|
| 最低模式 | 约 10 秒/天 | 晨重趋势 + 蛋白质是否大致达标 + 异常饮食 | 保持/增加/减少的大方向 | 维持期、讨厌记录者 |
| 快速模式 | 每餐 15–30 秒 | 照片或语音 → 食材候选 → 份量档位 | 热量与宏量区间、缺口提示 | 普通减脂/增重 |
| 精确模式 | 每餐 1–3 分钟 | 称重、条码、菜谱、油与调料 | 数值目标、周调整、微量营养可选 | 短期严格阶段、数据型用户 |
不是“餐单”,而是可替换的约束模板
- 输出“早餐 30–40g 蛋白 + 一份水果”的结构,而不是强制某道菜。
- 支持食堂、外卖、家庭餐三个情境;给常见菜的份量区间和“油量未知”提示。
- 一顿偏离后重算当天/本周,不使用羞辱语气,也不要求“明天补偿性少吃”。
- 根据体重趋势和真实摄入逐周调整,而不是相信通用 TDEE 单点值。
- 用户只想练好时,营养模块可以完全静默。
动作与器械库:从“多”改成“当下有用”
一个高质量动作条目必须包含
执行层
- 10–25 秒真实示范视频:正面/侧面
- 器械设置与起始姿势
- 最多三个动作提示
- 呼吸、节奏与有效活动范围的可选说明
决策层
- 动作模式、主/次肌群与稳定需求
- 设备/配件与最小配重
- 按原因组织的替代:被占、疼痛、居家、技术难
- 个人历史、单位与器械型号映射
建议首版 60 个高频动作,覆盖杠铃、哑铃、绳索与主流固定器械;每个动作至少 2–4 个明确替代。比起快速堆到 800 个,更重要的是素材审核、中文命名同义词、器械差异和替代换算。
器械识别的正确路线
- 首版:用户建立“我的健身房”器械 profile;可从常见模板勾选。
- 第二步:扫描器械二维码/铭牌,匹配品牌和型号;无法识别时由用户确认。
- 第三步:照片辅助识别设备类别、配重单位与可调范围,永远保留人工修正。
- 不要做:仅凭外观假设机器阻力曲线、滑轮倍率或等效自由重量。
计算机视觉动作反馈
视觉功能应从“可验证的单一任务”开始,例如固定机位的深蹲计次或节奏,不从“AI 看一眼告诉你动作标不标准”开始。每个动作单独建立教练标注集,跨体型、衣着、遮挡、光线和机位测试;低质量输入直接显示“无法可靠判断”。
安全、隐私与信任不是法务尾项
法规《个人信息保护法》将医疗健康和生物识别等列为敏感个人信息;处理需有特定目的、充分必要性、严格保护措施,并通常取得单独同意。[5]面向境内公众提供生成式 AI 服务还涉及透明度、准确可靠、非必要信息收集、输入与使用记录保护等要求;是否需要备案/安全评估要由具体服务形态和法律意见判断。[6][7]
本节是产品与工程风险清单,不构成法律意见;上线前需由熟悉中国数据与生成式 AI 监管的律师审查。
应直接做成产品的信任能力
| 能力 | 用户看到什么 | 系统要求 |
|---|---|---|
| 数据最小化 | 不授权睡眠/照片也能完整训练 | 每类数据单独目的与权限;默认关闭非核心采集 |
| 推荐解释 | 依据、变化、置信度、规则版本 | 保存建议快照与输入摘要;可重放 |
| 覆盖与撤销 | 一键恢复上次计划,自动化可关闭 | 不可变事件日志;计划版本控制 |
| 删除与导出 | 结构化 CSV/JSON 导出,账号与云数据删除进度 | 数据地图、保留期限、删除作业可验证 |
| 模型边界 | 何时不确定、何时建议专业人员 | 红旗规则、拒答策略、人工审核样本 |
| 训练数据控制 | 明确选择是否用于改进模型 | 同意与服务必要处理分离;去标识与访问控制 |
健康与疼痛分流
- 产品定位为一般健身与行为辅助,不宣称诊断、治疗或预防疾病。
- 新发、严重、持续或伴随其他异常的疼痛进入停止/就医提示,不继续自动加量。
- 特殊人群或既往病史不由通用对话生成方案;需要专业人员或专门、验证过的路径。
- 所有高风险提示由规则触发,LLM 只负责把已批准文本解释清楚。
2–5 人团队的六个月 MVP
第 0–3 周 · 先卖“决定”,不写完整产品
访谈 30 名目标用户;观察至少 10 次真实训练记录;用 Figma/人工教练后台模拟“下一组建议”和周复盘。招募条件必须是当前或近期真实记录者。
交付:痛点排序、现有记录迁移样本、10 名设计伙伴、付费意向页面。
第 1–2 月 · 做一个比现有工具更可靠的记录器
Android 本地优先;计划创建/CSV 导入、60 动作、组级记录、上次表现、计时、预填、撤销、离线、同步冲突与崩溃恢复。
刻意缺席:聊天、营养、社区、复杂图表。
第 3 月 · 加入可解释的三种进阶
双进阶、RIR 当日调整、top set/back-off;先给 20–30 名设计伙伴,建议前后都保存版本,覆盖原因成为必选但一键完成。
第 4 月 · 处理真实世界
器械 profile、替换图谱、30/45/60 分钟压缩、漏练重排、疼痛安全分流、周复盘。
第 5 月 · 只加轻营养闭环
体重趋势、蛋白/热量方向、语音/照片生成可编辑候选、三档记录模式;先用授权或第三方数据,不建全量库。
第 6 月 · 付费 Beta 与取舍
100–200 名合格用户,运行至少 8 周 cohort;A/B 测试解释方式和年费,不靠折扣掩盖留存。删掉低使用且不影响结果的功能。
团队配置
| 角色 | 全职/兼职 | 关键责任 |
|---|---|---|
| Android / 产品工程 | 全职 | 训练会话、local-first 数据、离线与稳定性 |
| 后端 / 数据 / AI | 全职 | 同步、规则服务、特征、LLM schema、可观测性 |
| 产品 / 设计 / 研究 | 全职或创始人 | 访谈、流程、文案、实验与分析 |
| 力量训练教练 | 长期兼职 | 规则、动作本体、红队案例和内容审核 |
| 营养师 + 法律/隐私 | 按里程碑 | 营养边界、特殊人群、合规评审 |
MVP 完成定义
- 模型服务断网时,用户仍能创建、完成、编辑和恢复整次训练。
- 任意一条自动建议可追溯到输入、规则版本,可被覆盖、撤销和重放。
- 60 个动作的名称、视频、器械、提示和替代关系经教练审核。
- 关键埋点能区分:建议看见、接受、修改、拒绝、拒绝原因和后续结果。
- 可以完整导出训练数据并验证账号删除流程。
验证顺序与成功标准
待验证以下数值是管理用的 go/no-go 门槛,不是行业基准。它们的作用是防止团队在“有人说喜欢”时继续堆功能。
| 阶段 | 核心假设 | 实验 | 建议门槛 | 未达标怎么办 |
|---|---|---|---|---|
| 问题 | 下一步决策与记录摩擦足够痛 | 30 访谈 + 10 次现场观察 | ≥20 人当前记录/近期放弃;≥15 人主动提到进阶、替换或记录摩擦 | 若主要痛点是内容/监督,重新选人群 |
| 可用性 | 记录明显更快 | 与用户当前工具交叉测试 | 计划内一组完成中位数 ≤3 秒;无需键盘;≥70% 首次独立完成整练 | 停止加 AI,先修会话交互 |
| 信任 | 解释能使建议可接受 | 同一建议无解释/简短解释对照 | 合格建议采纳或轻改 ≥60%;用户能复述原因 ≥70% | 降低自动化,改成候选和教练模板 |
| 留存 | 闭环形成习惯 | 8 周合格 cohort | 第 4 周仍有有效训练周 ≥45%;第 8 周 ≥30% | 拆分记录器留存与建议留存,定位断点 |
| 结果 | 建议比单纯记录更有用 | 12 周、按训练经验分层比较 | 主要动作有可解释的表现趋势;疼痛/极端疲劳不升;用户报告决策时间下降 | 不要用活跃掩盖无结果 |
| 付费 | 用户愿为决策层付费 | 真实年费/押金,而非问卷 | 300 名合格线索中 ≥30 个真实付费或可退押金 | 重做价值主张或改为教练工具 |
唯一北极星指标
这个指标比 DAU、打开时长或聊天轮次更贴近结果。辅助指标包括:训练启动到第一组时间、组记录耗时、建议覆盖率、覆盖原因、计划外替换成功率、周复盘阅读/采纳、数据丢失率和第 8 周留存。
最值得先问的 12 个访谈问题
- 把你最近一次训练从进门到离开完整讲一遍。
- 你上一次决定给某动作加重量时,依据是什么?
- 给我看你现在的记录;哪些字段从来不填?
- 最近一次器械被占时,你怎么换?为什么?
- 哪次训练应用让你最烦?当时正要完成什么?
- 你如何知道计划正在有效?何时会怀疑它?
- 你上次平台期做了什么?谁告诉你的?
- 漏练一次后,原计划会发生什么?
- 你记录饮食的最近一次是什么时候?为什么开始/停止?
- 哪类建议你绝不会交给 AI?
- 如果系统改了你的计划,怎样的解释才够?
- 过去一年你为训练记录、计划或教练付过多少钱?实际购买记录是什么?
商业模式与真正的壁垒
定价建议
中国参照物跨度很大:训记当前应用商店页面可见低价/买断型心智,Keep 则把 AI 权益放在更高年费层。[11][9]小团队不应承诺低价终身买断,因为推理、同步、内容审核和支持都有持续成本。
| 层级 | 包含 | 测试价格 | 目的 |
|---|---|---|---|
| 免费 | 可靠记录、基础计划、历史、导入导出、基础动作内容 | ¥0 | 记录器本身形成数据与口碑,不把核心数据锁住 |
| Pro | 自适应进阶、周复盘、现实重排、语音、深度趋势、轻营养 | 年费 ¥168 / ¥228 / ¥298 做真实 A/B | 验证用户为“少思考 + 稳定进步”付费 |
| 教练协作 | 计划审阅、异步视频/消息、周报 | 后续按教练或服务定价 | 高风险/高价值案例升级给人 |
价格是实验区间,不是最终报价;先验证年费,再考虑月费。不要用连续免费试用掩盖价值不足。
什么能成为壁垒
个体响应数据
建议 → 用户选择 → 实际执行 → 后续表现的闭环,且按动作、器械、训练水平和生活约束分层。
动作与器械知识图谱
不是百科文本,而是替代关系、设备差异、个人换算和不确定性。
信任与可迁移
透明、可撤销、可导入导出看似削弱锁定,长期却减少采用风险,形成品牌。
训练中体验细节
三秒完成一组、不会丢数据、异常场景不断流,这些需要大量真实训练打磨,不能靠模型 API 一夜复制。
推断基础模型、拍照识别和聊天 UI 都会商品化;把它们当壁垒是危险的。壁垒只能来自高质量纵向数据、受审核的决策系统和长期信任。
主要风险,以及何时应该停止
| 风险 | 早期信号 | 缓解 | 停止/转向条件 |
|---|---|---|---|
| 记录器没有代差 | 用户仍回到训记/Hevy/表格 | 现场观察、迁移、三秒组记录、稳定性优先 | 4 周后核心用户的主记录迁移率 <50% |
| 不信任自动建议 | 高覆盖、关闭自动化、解释仍无效 | 候选式建议、一次改一项、专家模板 | 合格建议采纳/轻改持续 <35% |
| 数据太稀疏 | RIR、体重、原因缺失,模型无法区分 | 默认值、最小输入、置信度和冷启动规则 | 强迫输入才能有价值,导致留存显著下降 |
| 营养拖垮团队 | 大量食物纠错和客服,训练留存无提升 | 三档模式、第三方数据、区间表达 | 营养用户 8 周留存/结果无增益,就保持外接 |
| 视觉承诺过大 | 光照/遮挡下误判,用户把反馈当诊断 | 逐动作验证、质量门、主动弃权 | 教练标注集上达不到预设准确与弃权安全阈值 |
| 巨头快速复制 | 训记/Keep 上线相同卡片和进阶 | 更深的组级闭环、开放迁移、本地器械图谱 | 用户认为现有免费方案“完全足够”且迁移意愿低 |
| 合规/责任不可承受 | 需处理超出能力的特殊人群或敏感数据 | 缩小定位、最小化、专家与法律审查 | 核心价值必须依赖医疗宣称或无法取得合规数据 |
最终取舍清单
从明天开始的前三步
- 写一页招募问卷,找到 10 名训记/Hevy/表格的真实重度记录者;不要先找“对健身有兴趣”的泛用户。
- 做一个只有“上次—目标—本次—为什么”的训练组原型,带去健身房现场测点击、误触和注意力。
- 由教练人工在后台给出两周建议,验证用户是否在乎并信任“下一步”,再决定算法与模型投入。
来源与参考
优先列官方产品页、应用商店、企业披露与同行评审研究。评论用于发现问题,不代表总体样本;厂商用户量与功能效果为自述。
- 中华人民共和国个人信息保护法,尤其第二十八至三十条。中国网信网 / 法律全文
- 生成式人工智能服务管理暂行办法。中国网信网 / 官方规定
- 互联网信息服务算法推荐管理规定。中国网信网 / 官方规定
- Health Connect data types:训练会话、计划训练、营养、睡眠等。Android 官方文档
- Keep:AI 运动教练。App Store 产品页 / 厂商描述与动态价格
- Keep Inc. 2025 Annual Results。香港交易所公司披露;使用数据为公司口径
- 训记—训练计划专家。中国 App Store 产品页、版本记录与精选评论
- 薄荷健康。中国 App Store 产品页 / 厂商描述
- 硬汗健身。中国 App Store 产品页与评论线索
- Strong Workout Tracker Gym Log。Google Play 产品页
- Alpha Progression。厂商官方页
- Boostcamp。厂商官方页;规模数字为厂商口径
- MacroFactor AI Food Logging。厂商官方设计说明
- MyFitnessPal: Calorie Counter。Google Play 产品页 / 数据量为厂商口径
- Cronometer。厂商官方页
- Eat This Much — Meal Planner。Google Play 产品页
- Zing AI: Home & Gym Workouts。Google Play 产品页与评论线索
- Freeletics。厂商官方页;规模数字为厂商口径
- Trainerize。厂商官方页;规模数字为厂商口径
- GymStreak: AI Personal Trainer。Google Play 产品页
- Fitbod App Store reviews。用户评论样本,仅作方向性线索
- Keep 中国 App Store reviews。用户评论样本,仅作方向性线索
- Comprehensiveness, Accuracy, and Readability of Exercise Recommendations Provided by an AI-Based Chatbot。JMIR Medical Education, 2024
- Using Large Language Models to Enhance Exercise Recommendations and Physical Activity: Scoping Review。JMIR Medical Informatics, 2025