AI 健身应用:从第一性原理到六个月可验证产品

首发市场 中国 滩头用户 每周规律力量训练 2–5 次的人 团队假设 2–5 人,六个月 研究截止 2026-09-12

这不是一份“功能越多越好”的清单,而是一套产品判断:哪些问题值得解决、AI 应该在哪里介入、哪里必须克制,以及小团队如何用真实留存和结果数据证明产品成立。

Executive answer

一页结论

最终判断:训练记录是通用刚需;完整饮食记录与固定餐单不是所有健身用户的日常刚需;动作大全更不是壁垒。真正未被做好的是一个低输入、可解释、会在每次训练后更新的“训练决策系统”。
01

不要做内容平台

Keep 已经证明内容、社区、硬件和商业化可以做得极广。小团队若从课程数量竞争,获客、版权和制作成本都会输。

02

不要做 AI 聊天壳

用户在深蹲组间不想聊天。他需要系统已经把下一组重量、次数、休息和替代动作算好,并允许一键接受或撤销。

03

做“下一步”

核心价值不是展示更多数据,而是把数据变成一个可信决定:今天练什么、下一组怎么做、计划为何改变。

建议的产品定义

“当我走进健身房,即使器械被占、状态波动或生活打乱,我也能在几秒内知道下一步怎么练;做完以后,系统能解释结果并可靠地更新下周计划。”

建议暂用工作名“动策”:面向中国规律力量训练者的、以结果为目标的自适应训练助手。它首先是一个极快的训练记录器,其次是一个透明的渐进超负荷与恢复决策引擎,最后才是对话式 AI。

产品护城河的顺序

  1. 训练中零摩擦

    历史值、目标值、当前值同屏;预填、单手操作、离线、崩溃恢复、语音补录。没有这一层,任何 AI 都没有高质量数据。

  2. 可解释的调整

    推荐必须写清“依据、变化、置信度、可撤销”。算法适应用户,而不是用户服从黑盒。

  3. 中国场景的闭环

    商业健身房器械差异、中式混合餐、外卖与食堂、国产 Android 和健康平台,都是国际应用做不深的本地语境。

  4. 长期结果数据

    真正的数据资产是“什么调整对什么人、在什么条件下有效”,不是聊天记录,也不是一个静态动作库。

六个月只做这些

  • P0:计划导入/创建、组级记录、休息计时、上次表现、训练中替换、离线与恢复。
  • P0:基于次数区间、RIR/RPE、近期表现和疲劳信号的下一组/下一次建议;每条建议可解释、可覆盖。
  • P0:周复盘只给最多三个决定:加重量、减量/减载、维持或换动作。
  • P1-light:体重趋势、蛋白质下限、热量方向和三档饮食记录;不自建“百万食物库”。
  • 内容:先做 60 个高频动作与清晰替代关系,不做“全动作百科”。
明确不做:首版社交信息流、商城、泛聊天机器人、每天自动生成完全不同的训练、全动作实时姿态纠错、根据手表热量反推饮食、刚性七日餐单。
Scope & method

范围与方法

本研究把公开证据分成四类:官方产品页/应用商店功能,企业披露,同行评审研究,以及应用商店用户评论。前两类能说明产品实际主张与战略,研究用于确定技术和健康建议边界,评论仅用于发现高频问题线索,不能当作总体用户比例

已回答

  • 健身房和居家训练的关键任务与摩擦
  • 训练、饮食、动作库的刚需等级
  • 国内外代表性竞品的强项与缺口
  • AI/LLM/CV 应放在哪一层
  • 六个月 MVP、指标、定价与停止条件

尚未被桌面研究证明

  • 中国规律训练者的付费意愿分布
  • 推荐解释能否显著提高采纳率
  • 中式混合餐快速记录的真实留存增益
  • 目标人群的第 8 周留存与长期训练结果
  • 各国产健康平台可稳定取得的数据范围

事实Keep 在 2025 年年报中将战略表述为从内容平台走向 AI 驱动生态,并披露多智能体、主动教练、自定义计划、语音跑步与食物图片分析等使用数据;这是公司口径,但足以说明“大而全 + AI”赛道已有强者。[10]

推断因此“比 Keep 多一个 AI 计划”不是差异化。研究重点应转向现有产品不愿或难以优化的高频窄场景:组间 30–180 秒内的决策、计划调整的透明度、数据可靠性与本地器械/饮食环境。

阅读约定:事实可由来源直接支持;推断是对多个事实的产品解释;建议是本文的设计选择;待验证必须通过访谈或实验验证。
First principles

从结果倒推产品,而不是从功能正推

长期结果 ≈ 有效刺激 × 恢复 × 营养 × 执行一致性 × 时间

这是一个乘法系统:计划再科学,若用户无法持续执行,结果仍接近零;记录再完整,若不能改变下一个决定,数据价值也接近零。对产品而言,价值可以进一步写成:

用户净价值 = 更好的下一步决策 − 输入成本 − 认知负担 − 不信任与风险

五个不可回避的问题

一项功能只有在帮助用户更好地回答以下至少一个问题时,才有资格进入核心产品:

  1. 今天练什么?目标、周期、可用时间和器械决定今天的刺激。
  2. 下一组做多少?重量、次数、RIR/RPE、休息和技术状态决定即时负荷。
  3. 现实变了怎么办?器械被占、出差、疼痛、睡眠差和漏练都需要低成本重排。
  4. 训练有效吗?用户需要看趋势、停滞和原因,而不是更多图表。
  5. 训练之外要改什么?只在营养、体重趋势或恢复确实限制目标时提出下一步。

科学原则应该变成“有边界的引擎”

事实ACSM 的阻力训练进阶立场强调,负荷、容量、频率和休息要随目标与训练水平变化;其中一种进阶规则是在用户连续超出目标次数时逐步增加负荷。[1] RIR/RPE 可帮助调节当日负荷,但原始证据来自有限动作与样本,并不等于对每个人都精确。[2]

推断产品不应输出“唯一正确重量”,而应给出一个受约束的候选值、依据和不确定性。用户的覆盖行为是训练数据,不是“错误”。

观察

组级表现、RIR、体重趋势、疼痛、时间与器械

解释

区分随机波动、疲劳、计划问题与执行问题

决定

下一组、下一练、下周只改变必要变量

执行

一键接受、语音记录、替换、离线完成

学习

比较建议、实际选择和后续结果,更新个体模型

User selection

先服务谁:规律训练者,而不是“所有想变健康的人”

人群最强任务现有替代产品机会首发建议
健身房新手不会选动作、不会判断动作是否安全Keep 课程、私教、短视频引导与动作教育大,但责任和内容成本也高第二阶段
规律力量训练者稳定进步、少思考、应对器械和状态变化纸笔、表格、训记、Strong/Hevy、教练记录频率高、历史数据有价值,且透明决策仍弱首发
高级训练者完全自定义、周期控制、深度数据表格、RP、Alpha、教练愿意提供数据但容忍度低,会挑战算法共同设计者
居家训练者低器械、短时间、坚持与动作跟练Keep、Freeletics、视频平台语音/视觉引导明显,但内容与获客竞争激烈不与首发混做
减脂主导用户饮食执行、体重趋势、情绪与生活约束薄荷、MyFitnessPal、MacroFactor营养价值高,但会把团队拉进另一套数据与行为问题训练用户的可选模式

滩头用户画像

纳入

  • 每周力量训练 2–5 次,已持续至少 8 周
  • 知道基础动作,但不一定懂编程
  • 正在记录,或因麻烦/无反馈放弃过记录
  • 目标为增肌、力量或减脂保肌
  • 主要使用商业健身房,Android 优先

暂不纳入

  • 术后康复、疾病处方、孕产等医疗场景
  • 完全依赖视频跟练的零基础用户
  • 专项竞技备赛与药物相关建议
  • 需要实时多人课程或教练工作室 SaaS
  • 只想获得食谱、买课或社交打卡的人

建议居家训练不是删掉,而是作为同一引擎的另一种“器械配置”在验证核心闭环后扩展。首发同时做健身房和居家,会迫使动作内容、交互、获客话术和成功指标全部分叉。

Pain map

真正的痛点发生在一整条训练旅程里

时刻用户脑中的问题当前摩擦机会
训练前今天练什么?状态差要不要改?计划静态;应用只展示清单;用户自己猜30 秒状态检查 + 有理由的最小调整
热身热身组怎么上?今天重量是否合适?热身方案散落在笔记;算法很少观察热身表现按工作重量自动预填;异常表现触发保守调整
组间刚做了多少?下一组加不加?休多久?湿手、手套、单手、注意力分散;多次点击和键盘中断节奏上次/目标/本次同屏;一键确认;语音补录;自动计时
器械被占换什么才等价?换了以后重量怎么算?普通动作库只列动作,不理解刺激、技术与器械差异按肌群、动作模式、稳定性、负荷曲线和个人历史替代
训练结束今天好还是不好?下次要改什么?总容量与 PR 不能解释疲劳或技术妥协仅总结偏差与下一次变化,不做数据烟花
一周后我是否真的进步?为何卡住?图表很多,行动建议很少;或 AI 无理由重写计划稳定基线 + 一次改变一个变量 + 版本记录
生活打断漏练、出差、只有 30 分钟怎么办?“未完成”被当失败;计划整体失效保留优先动作与周刺激,压缩/顺延/重排
饮食今天吃得是否足以支持目标?称重太累,拍照又假装精确;中式混合餐、油量和份量难判断三档精度、可编辑拆分、区间和趋势反馈

评论证据揭示的不是“缺功能”,而是“失去控制”

评论线索Fitbod 的评论既肯定“无需思考今天练什么”、器械配置和动作替换,也抱怨训练开始后导航受限、Watch 同步/冻结、AI 在编辑时插入逻辑,以及缺少针对受限动作和技术问题的反馈。[31]

评论线索训记的精选评论集中在“何时加重量/平台期怎么办”、训练中需要直接比较上次表现、计时和录入多一步、食物自定义与排序等;Keep 评论则出现界面拥挤、关键数据层级变深、训练中看屏幕不安全,以及对热量估算可信度的疑虑。[11][32]

推断用户并不排斥算法;他们排斥的是算法在错误时刻夺走控制、不给原因、不能撤销,或因为同步/导航失败破坏了训练主任务。

痛点优先级

  1. 决策不确定

    “今天/下一组到底做什么”比“有没有更多动作”更频繁、更接近结果。

  2. 记录摩擦

    没有连续、可信的行为数据,个性化只能退化成问卷标签。

  3. 现实变化

    好计划不是从不变化,而是在器械、时间、恢复变化时仍保住关键刺激。

  4. 反馈不可行动

    PR、容量和热量都是中间指标;用户需要下一个最小改变。

  5. 信任与安全

    黑盒推荐、伪精确营养和泛化姿态纠错会迅速消耗信任。

Must-have test

哪些是刚需,哪些只是看起来完整

功能等级为什么首版边界
训练计划与组级记录通用刚需承载执行与后续判断,是纵向数据源预填、复制上次、单手、离线、崩溃恢复
训练中“下一步”建议核心刚需直接降低认知负担并改变结果重量/次数/RIR/休息;理由与撤销
计划自适应核心刚需静态计划无法处理疲劳、漏练与现实器械只做小步调整,不每天重写
进步诊断核心刚需用户想知道是否有效以及下一步,不只是看图周复盘最多三条动作
动作替代与器械配置场景刚需商业健身房最常见的中断之一先覆盖高频动作和明确替代关系
动作示范与关键提示上下文刚需使用时有价值,脱离计划的“大百科”使用频率低真实视频 + 三个提示 + 常见错误 + 替代
体重/围度/照片趋势目标刚需训练表现不等于体成分结果趋势优先,不用单日波动做决策
完整饮食记录条件刚需减脂/增重阶段很重要,维持期未必值得每日成本精确、快速、最低三种模式
固定餐单与菜谱可选工具能降低决策,但与外卖、食堂、家庭饮食冲突给“模板与替换”,不要求照表吃
完整动作/器械大全非刚需广度容易复制,质量难维护;不直接解决下一步60 个高频动作比 1000 个低质量条目更好
AI 聊天交互方式聊天不是用户目标;高频场景甚至更慢用于异常、解释和自然语言录入
社交、勋章、商城非首版可能促活或变现,但稀释核心任务只保留可选择的轻量问责/分享
对你原始想法的直接回答:“记录健身”是刚需;“记录饮食、计划饮食”对有明确体重/体成分目标的人是刚需,对所有规律训练者不是;“所有动作和器材示意图”应改成训练当下可调用的高质量、个体化说明与替代。
Market map

市场不是一个赛道,而是六种价值主张

类别代表产品用户购买的价值典型缺口
记录器Strong、Hevy、训记、GymStreak快速、稳定、历史、统计记录后仍需用户自己编程与诊断
算法训练Fitbod、Alpha Progression、RP Hypertrophy少思考、自动负荷/容量与计划黑盒、泛化、用户失控或目标过窄
计划市场Boostcamp可信教练计划 + 自动进阶 + 记录计划选择仍复杂,跨计划的个体学习弱
营养记录/教练MacroFactor、MyFitnessPal、Cronometer、薄荷食物数据库、目标、趋势与调整力量训练决策层薄,中文混合餐精度难
内容与综合生态Keep、Freeletics、硬汗课程、跟练、内容、广覆盖功能密度高;严肃训练的组级反馈不够深
人类教练平台Caliber、Trainerize问责、解释、视频反馈与关系贵、难规模化;需要教练供给
综合 AI agentCora、Zing训练、营养、睡眠、日程联动承诺广、证据和控制感不足;本地化弱

推断功能已经高度商品化:计划生成、动作库、拍照识餐、聊天和简单恢复分数都能被快速复制。市场仍缺的是同一套纵向状态模型把这些输入变成少量、可追溯的训练决定。

Competitive review

竞品逐类拆解:该学什么,不该复制什么

中国市场

产品当前强项暴露出的不足应吸收的设计原则
Keep课程、品牌、社区、硬件与 AI 生态;应用描述已覆盖健身房记录、饮食拍照、吃练睡洞察和 AI 教练。[9]广度带来信息架构负担;评论中出现关键数据难找、训练中需看屏幕、热量估算信任等问题。[32]不争“最多内容”;把训练会话从生态噪音中彻底隔离。
训记中国严肃力量训练记录心智强;已有计划、容量分析、动作库、Watch。2026 版本记录显示其正加入食物扫描/语音、TDEE、智能计划与 Agent 数据接口。[11]评论仍在问何时加重量、平台期和实时对比;这说明“有数据”不等于“有决定”。它是最直接的中国竞品;必须在解释性自动进阶和训练中效率上出现可感知代差。
薄荷健康中文食物数据、减重心智、AI 拍照/语音、体重饮食睡眠与教练。[12]核心仍是体重管理;严肃力量训练的动作、进阶和组级反馈不是主战场。营养层应合作/接入/导入,而不是六个月复制其数据库。
硬汗健身器械与居家场景、问卷生成计划、动作内容,定位容易理解。[13]用户评论出现强付费墙、订阅体验和不现实转化预期等线索;算法差异不透明。价值先于付费墙;避免“21 天改造”式承诺。

全球市场

产品最值得学仍未解决
Strong / Hevy把组级记录、模板、计时、历史、RPE、盘片计算和社交做得成熟;Hevy 还以训练社交和复制计划形成网络效应。[14][15]默认用户能自己决定计划与调整;高级统计仍不自动等于建议。
Fitbod用近期历史、肌群恢复、器械、目标和偏好生成训练;替换动作和器械 profile 很实用。[16]“每天新鲜”可能破坏稳定基线;评论出现编辑控制、Watch 同步与受限动作处理问题。[31]
Alpha Progression给到下一组重量、次数与 RIR;计划相对稳定,并包含周期和减载。[17]对生活约束、营养与跨平台数据闭环覆盖有限;强项容易被本地产品复制。
RP Hypertrophy用泵感、酸痛、负荷感受反馈调整增肌容量,形成明确的周反馈闭环。[19]聚焦增肌,输入和方法体系对大众偏重;不适合所有目标。
Boostcamp可信教练计划库与记录器结合,降低“算法凭什么”的信任门槛。[18]计划资产强,但对同一用户跨计划的长期响应学习不一定是核心。
MacroFactor用摄入记录和体重趋势反推个体消耗,按周调整;坚持中立、不因“超标”羞辱用户。[20]营养闭环极强,但力量训练过去不是核心;中国食物和平台生态不占优。
MyFitnessPal / Cronometer前者数据库与生态广,后者验证食物和微量营养深。[22][23]数据广不等于对力量训练者的最小可行动反馈。
Eat This Much根据目标、偏好、预算与日程自动排餐,并能替换与生成采购清单。[24]计划容易与真实社交饮食、食堂和外卖脱节;遵循成本高。
Zing / Freeletics把 AI 个性化、日程与家庭/健身房场景包装成教练体验。[25][26]Zing 评论中出现用户期待全程动作跟踪、实际相机能力有限,以及计划难度不当的落差;说明“AI”标签会抬高预期。
Caliber / Trainerize人类教练的视频反馈、日常消息、周复盘,以及训练/营养/习惯管理。[27][28]关系和判断质量强,但成本、供给和一致性限制规模。
Cora最接近未来形态:训练、营养、睡眠、恢复和日程共同驱动,用户可在应用或文本中记录,生活变化后主动调整。[29]广而新的 agent 产品仍要证明长期效果、控制感和安全;iOS/Apple Health 优先,也留下中国 Android 的空间。

注:产品人数、评分、食物/动作数量等若来自厂商或应用商店,仅代表其公开主张,不视为独立审计结果;动态价格与功能会变化。

White space

竞品的六个结构性缺口

  1. “记录”和“教练”分裂

    记录器保留控制但不下判断;AI 教练下判断但缺少可审计的组级数据。机会是让每个决定都回到原始记录。

  2. 推荐在黑盒里

    很多产品展示结果,不展示“因哪三条数据、改了哪个变量、没改什么”。一旦建议不合适,用户只能全盘接受或离开。

  3. 把变化误当个性化

    每天换训练看起来智能,却减少可比性和技术练习。更好的个性化是稳定框架内的必要调整。

  4. 输入精度与反馈精度不匹配

    一张中式餐照片无法可靠看出用油和份量,却常输出个位数千卡;手表能量消耗也不应被当成精确摄入预算。消费级腕戴设备研究显示心率与能量消耗的准确性并不等价。[4]

  5. 训练当下仍像“填表”

    同步失败、多层导航、键盘、不能离开训练页、不可撤销自动化,都会在最需要专注时制造摩擦。

  6. 健康信号缺少信任治理

    疼痛、体重、照片、睡眠和生理数据高度敏感;多数产品把隐私当条款,而不是产品能力。

可占领的位置:“最可信、最快的中国力量训练决策层”。不是动作最多、聊天最像人,也不是覆盖最广,而是每次训练都可靠地减少一个真实决定。
Product strategy

产品战略:稳定计划里的主动协助

定位句

建议对于已经规律训练、但不想自己维护表格和猜测进阶的中国健身房用户,“动策”是一个训练中几乎不打扰、训练后能解释并自动更新计划的力量训练系统。

四条不可妥协的产品原则

先行动,后聊天

默认给可执行卡片;只有异常、解释和补充输入才进入对话。AI 不是首页上的输入框。

稳定优于新奇

计划保留数周基线,只有证据达到阈值才改变;变化必须可回看、可撤销。

承认不确定

营养给区间,恢复给信号而非真相,视觉模型不确定时放弃判断,疼痛进入安全分流。

用户拥有数据

可导入、导出、删除;训练中离线可用;自动化永远允许覆盖。

信息架构

一级入口核心内容刻意不放
今天今日训练、准备度、最近趋势、最多一条恢复/营养提醒资讯流、广告、商城
训练正在进行的会话、计划、历史与导入社区动态
进展力量趋势、执行率、体重/围度与周复盘无法行动的几十张图
动作高频动作、个人器械、替代关系和技术提示未经审核的 UGC 教程
我的目标、限制、数据权限、导入导出、算法与隐私控制强制社交身份
Core experience

六个关键界面,而不是六十个功能页

01 · 今天

首屏答案:“上肢 A,预计 52 分钟;卧推维持 75 kg,因为上次达到次数但 RIR 低于目标。”

  • 状态检查只问会改变计划的变量:可用时间、异常疼痛、极端疲劳。
  • 睡眠/心率数据若可得只作背景,不强迫每日主观问卷。
  • “按原计划”“保守版”“30 分钟版”三选一。

02 · 训练中

一屏一件事:动作、上次、目标、本次、计时器。

  • 预填重量与次数;点一次完成,长按修改,滑动撤销。
  • 语音:“七十五公斤八次,还能两次”解析为结构化记录,并立即回读确认。
  • 所有写入先本地完成;网络不稳定不影响训练。

03 · 快速替换

点击“器械被占/不舒服/不想做”,候选动作按刺激接近度、个人熟悉度、当前器械和历史负荷排序,并自动换算起始建议。

不能只按“同一肌群”替换;自由重量卧推与器械推胸的稳定需求、技术与负荷不可直接等同。

04 · 训练结束

只展示三件事:完成了什么、哪里偏离、下次会改变什么。让用户确认“系统理解得对不对”,而不是庆祝动画占满屏。

05 · 周复盘

最多三张决策卡:例如“卧推 +2.5 kg”“腿举本周维持”“下周总组数 -2”。每张卡可展开依据、查看反事实、接受、修改或跳过。

06 · 营养与恢复

不是第二个 MyFitnessPal。默认显示体重趋势、蛋白质完成范围、热量方向和一个下一步;精确记录仅在用户进入明确增/减重周期时开启。

关键异常路径:漏练一次不判失败;计划自动给“顺延 / 合并 / 跳过低优先动作”。出现新疼痛时,停止对该动作自动加量,询问严重程度与持续时间,提供保守替代或建议线下专业评估,不做诊断。
Decision engine

训练决策引擎:小步、透明、可回退

引擎需要的最少数据

稳定画像

目标、训练经验、可用天数、常用器械、动作限制、单位与偏好。

训练事件

动作、负荷、次数、组型、RIR/RPE、休息、完成/跳过、替换与原因。

结果与约束

体重趋势、围度、疼痛、极端疲劳、可用时间;可穿戴只是可选背景。

首版只实现三种可审计进阶

模式适用示例规则为什么首版可控
双进阶多数固定动作先在目标次数区间内增加次数;连续达到上限且 RIR 在目标范围,再加最小可用重量用户易理解、易验证、与器械最小配重兼容
RIR 自动调节当天状态波动若实际 RIR 明显低于目标,下一组保守降重/降次数;反之小幅增加只改当前负荷,不重写整个计划
Top set + back-off有经验、主项稳定者用顶组表现估算当天能力,再计算回退组;低置信度时保持上次值能兼顾强度与状态,但仅开放给有足够历史的用户

这些是产品规则示意,不是面向个人的训练处方。实际阈值需由教练审核,并通过真实数据按动作、器械和训练水平校准。

决策顺序

  1. 硬约束先行:疼痛红旗、器械不可用、计划总时长、用户禁用动作。
  2. 判断数据够不够:历史不足或记录异常时,不生成“个性化”精确数值。
  3. 生成有限候选:保持、加量、减量、替换;每次尽量只改变一个变量。
  4. 规则与个体响应排序:比较最近 2–4 次同动作/同模式表现及恢复。
  5. 输出解释:证据、变化、置信度、风险与替代方案。
  6. 采集覆盖原因:太重、器械、疼痛、时间、偏好;用结果而非服从度训练模型。
反例:“你昨晚只睡了 5 小时,所以所有动作减重 12%”是假精确。更稳妥的设计是把睡眠作为弱信号,结合热身表现和用户感受;若信号冲突,保留原计划并建议首个工作组后再判断。
AI architecture

AI 应该是翻译器与排序器,不是无边界处方者

研究边界一项针对 26 类临床人群的研究发现,通用聊天模型给出的运动建议中,已提供内容多数准确,但完整性只有约 41%,且可读性偏高;后续范围综述也强调目前仍应作为专家补充而非替代。[33][34]

推断LLM 可把“今天胸没状态,史密斯还被占了”解析成约束,也能把结构化决策解释成人话;但它不应独立计算训练负荷或自由生成伤病建议。

交互层
自然语言、语音与卡片。LLM 负责意图解析、追问和解释;高频路径仍用确定性交互。
安全与约束层
硬规则先于模型。疼痛分流、禁用动作、最大变化幅度、年龄/健康声明、隐私权限与输出 schema。
候选与决策层
规则引擎 + 时间序列特征。产生有限候选,按目标、近期响应、疲劳和用户偏好排序;记录版本。
知识层
经审核的动作本体与证据库。动作模式、肌群、器械、稳定需求、禁忌/替代、教学素材及版本来源;RAG 只从此检索。
事件与状态层
本地优先的结构化训练日志。组、会话、计划、建议、覆盖、体重趋势、权限和删除状态;原始记录不可被模型悄悄改写。

各技术的正确职责

技术适合不适合上线门槛
LLM语音/文本结构化、解释、周总结、异常追问直接、不受约束地制定负荷和伤病判断schema 校验、引用依据、红队测试、回退模板
规则引擎进阶、变化幅度、硬约束、安全分流处理含糊自然语言和长尾表达教练审核、单元测试、版本化、可重放
个体响应模型从纵向数据估计什么调整更可能有效冷启动时假装精确基线比较、置信区间、分群公平性与漂移监控
计算机视觉有限动作的计次、节奏、明显活动范围;拍照拆分候选食物单相机对所有动作做伤病诊断和“标准姿势”裁决固定动作逐个验证、拍摄质量门、低置信度主动放弃
可穿戴数据训练时长、心率背景、睡眠趋势与会话同步用当天消耗数字精确决定进食来源透明、可关闭、缺失时不降级核心体验

Android 首发的务实路径

Health Connect 已定义训练会话、计划训练、营养、睡眠、体重等数据类型和细粒度权限,可作为兼容层之一。[8]但中国设备生态不能假设只靠一个接口:首版应把核心训练日志完全掌握在应用本地数据库中,把平台同步做成可插拔适配器,并逐家验证厂商行为。

建议移动端采用 local-first:写入立即成功、后台增量同步、事件去重与冲突合并;服务端保存规则版本和建议快照,使任何一次推荐都能重放。LLM 调用异步化,训练主流程在模型不可用时仍完整工作。

Nutrition strategy

饮食要做,但应该做成“可选择的精度”

研究边界2025 年一项系统综述纳入 13 项 AI 饮食评估研究;多数仍处于前临床场景,研究间相关性跨度大,且多数存在中等偏倚风险。结论是有潜力,但仍需更大、更广泛人群验证。[3]

竞品启发MacroFactor 的 AI food logging 不把聊天感作为卖点,而是把一句话或照片拆成可编辑食材,再落到结构化食物库;其公开说明也明确 AI 会出错。[21]这是比“拍照即得到精确热量”更可信的交互。

三档记录模式

模式用户成本输入反馈适合
最低模式约 10 秒/天晨重趋势 + 蛋白质是否大致达标 + 异常饮食保持/增加/减少的大方向维持期、讨厌记录者
快速模式每餐 15–30 秒照片或语音 → 食材候选 → 份量档位热量与宏量区间、缺口提示普通减脂/增重
精确模式每餐 1–3 分钟称重、条码、菜谱、油与调料数值目标、周调整、微量营养可选短期严格阶段、数据型用户

不是“餐单”,而是可替换的约束模板

  • 输出“早餐 30–40g 蛋白 + 一份水果”的结构,而不是强制某道菜。
  • 支持食堂、外卖、家庭餐三个情境;给常见菜的份量区间和“油量未知”提示。
  • 一顿偏离后重算当天/本周,不使用羞辱语气,也不要求“明天补偿性少吃”。
  • 根据体重趋势和真实摄入逐周调整,而不是相信通用 TDEE 单点值。
  • 用户只想练好时,营养模块可以完全静默。
是否自建食物库?首版答案是不。优先接入合规数据源或允许从现有应用导入/汇总;自建中文品牌食品、菜谱、食堂与外卖数据是一条独立业务。只有当 8 周数据证明营养闭环显著提升留存或结果,才投入专门团队。
Exercise & equipment

动作与器械库:从“多”改成“当下有用”

一个高质量动作条目必须包含

执行层

  • 10–25 秒真实示范视频:正面/侧面
  • 器械设置与起始姿势
  • 最多三个动作提示
  • 呼吸、节奏与有效活动范围的可选说明

决策层

  • 动作模式、主/次肌群与稳定需求
  • 设备/配件与最小配重
  • 按原因组织的替代:被占、疼痛、居家、技术难
  • 个人历史、单位与器械型号映射

建议首版 60 个高频动作,覆盖杠铃、哑铃、绳索与主流固定器械;每个动作至少 2–4 个明确替代。比起快速堆到 800 个,更重要的是素材审核、中文命名同义词、器械差异和替代换算。

器械识别的正确路线

  1. 首版:用户建立“我的健身房”器械 profile;可从常见模板勾选。
  2. 第二步:扫描器械二维码/铭牌,匹配品牌和型号;无法识别时由用户确认。
  3. 第三步:照片辅助识别设备类别、配重单位与可调范围,永远保留人工修正。
  4. 不要做:仅凭外观假设机器阻力曲线、滑轮倍率或等效自由重量。

计算机视觉动作反馈

视觉功能应从“可验证的单一任务”开始,例如固定机位的深蹲计次或节奏,不从“AI 看一眼告诉你动作标不标准”开始。每个动作单独建立教练标注集,跨体型、衣着、遮挡、光线和机位测试;低质量输入直接显示“无法可靠判断”。

安全边界:ROM、节奏或明显左右差可以作为观察信号;疼痛原因、损伤风险和临床诊断不应由单相机模型输出。视觉反馈必须说明拍摄条件、置信度和它没有判断的内容。
Trust & compliance

安全、隐私与信任不是法务尾项

法规《个人信息保护法》将医疗健康和生物识别等列为敏感个人信息;处理需有特定目的、充分必要性、严格保护措施,并通常取得单独同意。[5]面向境内公众提供生成式 AI 服务还涉及透明度、准确可靠、非必要信息收集、输入与使用记录保护等要求;是否需要备案/安全评估要由具体服务形态和法律意见判断。[6][7]

本节是产品与工程风险清单,不构成法律意见;上线前需由熟悉中国数据与生成式 AI 监管的律师审查。

应直接做成产品的信任能力

能力用户看到什么系统要求
数据最小化不授权睡眠/照片也能完整训练每类数据单独目的与权限;默认关闭非核心采集
推荐解释依据、变化、置信度、规则版本保存建议快照与输入摘要;可重放
覆盖与撤销一键恢复上次计划,自动化可关闭不可变事件日志;计划版本控制
删除与导出结构化 CSV/JSON 导出,账号与云数据删除进度数据地图、保留期限、删除作业可验证
模型边界何时不确定、何时建议专业人员红旗规则、拒答策略、人工审核样本
训练数据控制明确选择是否用于改进模型同意与服务必要处理分离;去标识与访问控制

健康与疼痛分流

  • 产品定位为一般健身与行为辅助,不宣称诊断、治疗或预防疾病。
  • 新发、严重、持续或伴随其他异常的疼痛进入停止/就医提示,不继续自动加量。
  • 特殊人群或既往病史不由通用对话生成方案;需要专业人员或专门、验证过的路径。
  • 所有高风险提示由规则触发,LLM 只负责把已批准文本解释清楚。
Six-month build

2–5 人团队的六个月 MVP

第 0–3 周 · 先卖“决定”,不写完整产品

访谈 30 名目标用户;观察至少 10 次真实训练记录;用 Figma/人工教练后台模拟“下一组建议”和周复盘。招募条件必须是当前或近期真实记录者。

交付:痛点排序、现有记录迁移样本、10 名设计伙伴、付费意向页面。

第 1–2 月 · 做一个比现有工具更可靠的记录器

Android 本地优先;计划创建/CSV 导入、60 动作、组级记录、上次表现、计时、预填、撤销、离线、同步冲突与崩溃恢复。

刻意缺席:聊天、营养、社区、复杂图表。

第 3 月 · 加入可解释的三种进阶

双进阶、RIR 当日调整、top set/back-off;先给 20–30 名设计伙伴,建议前后都保存版本,覆盖原因成为必选但一键完成。

第 4 月 · 处理真实世界

器械 profile、替换图谱、30/45/60 分钟压缩、漏练重排、疼痛安全分流、周复盘。

第 5 月 · 只加轻营养闭环

体重趋势、蛋白/热量方向、语音/照片生成可编辑候选、三档记录模式;先用授权或第三方数据,不建全量库。

第 6 月 · 付费 Beta 与取舍

100–200 名合格用户,运行至少 8 周 cohort;A/B 测试解释方式和年费,不靠折扣掩盖留存。删掉低使用且不影响结果的功能。

团队配置

角色全职/兼职关键责任
Android / 产品工程全职训练会话、local-first 数据、离线与稳定性
后端 / 数据 / AI全职同步、规则服务、特征、LLM schema、可观测性
产品 / 设计 / 研究全职或创始人访谈、流程、文案、实验与分析
力量训练教练长期兼职规则、动作本体、红队案例和内容审核
营养师 + 法律/隐私按里程碑营养边界、特殊人群、合规评审

MVP 完成定义

  • 模型服务断网时,用户仍能创建、完成、编辑和恢复整次训练。
  • 任意一条自动建议可追溯到输入、规则版本,可被覆盖、撤销和重放。
  • 60 个动作的名称、视频、器械、提示和替代关系经教练审核。
  • 关键埋点能区分:建议看见、接受、修改、拒绝、拒绝原因和后续结果。
  • 可以完整导出训练数据并验证账号删除流程。
Validation

验证顺序与成功标准

待验证以下数值是管理用的 go/no-go 门槛,不是行业基准。它们的作用是防止团队在“有人说喜欢”时继续堆功能。

阶段核心假设实验建议门槛未达标怎么办
问题下一步决策与记录摩擦足够痛30 访谈 + 10 次现场观察≥20 人当前记录/近期放弃;≥15 人主动提到进阶、替换或记录摩擦若主要痛点是内容/监督,重新选人群
可用性记录明显更快与用户当前工具交叉测试计划内一组完成中位数 ≤3 秒;无需键盘;≥70% 首次独立完成整练停止加 AI,先修会话交互
信任解释能使建议可接受同一建议无解释/简短解释对照合格建议采纳或轻改 ≥60%;用户能复述原因 ≥70%降低自动化,改成候选和教练模板
留存闭环形成习惯8 周合格 cohort第 4 周仍有有效训练周 ≥45%;第 8 周 ≥30%拆分记录器留存与建议留存,定位断点
结果建议比单纯记录更有用12 周、按训练经验分层比较主要动作有可解释的表现趋势;疼痛/极端疲劳不升;用户报告决策时间下降不要用活跃掩盖无结果
付费用户愿为决策层付费真实年费/押金,而非问卷300 名合格线索中 ≥30 个真实付费或可退押金重做价值主张或改为教练工具

唯一北极星指标

有效训练周:用户在一周内完成其计划的最低有效刺激,并至少对一条系统决策产生“接受 / 修改 / 拒绝”的闭环反馈。

这个指标比 DAU、打开时长或聊天轮次更贴近结果。辅助指标包括:训练启动到第一组时间、组记录耗时、建议覆盖率、覆盖原因、计划外替换成功率、周复盘阅读/采纳、数据丢失率和第 8 周留存。

最值得先问的 12 个访谈问题

  1. 把你最近一次训练从进门到离开完整讲一遍。
  2. 你上一次决定给某动作加重量时,依据是什么?
  3. 给我看你现在的记录;哪些字段从来不填?
  4. 最近一次器械被占时,你怎么换?为什么?
  5. 哪次训练应用让你最烦?当时正要完成什么?
  6. 你如何知道计划正在有效?何时会怀疑它?
  7. 你上次平台期做了什么?谁告诉你的?
  8. 漏练一次后,原计划会发生什么?
  9. 你记录饮食的最近一次是什么时候?为什么开始/停止?
  10. 哪类建议你绝不会交给 AI?
  11. 如果系统改了你的计划,怎样的解释才够?
  12. 过去一年你为训练记录、计划或教练付过多少钱?实际购买记录是什么?
Business & moat

商业模式与真正的壁垒

定价建议

中国参照物跨度很大:训记当前应用商店页面可见低价/买断型心智,Keep 则把 AI 权益放在更高年费层。[11][9]小团队不应承诺低价终身买断,因为推理、同步、内容审核和支持都有持续成本。

层级包含测试价格目的
免费可靠记录、基础计划、历史、导入导出、基础动作内容¥0记录器本身形成数据与口碑,不把核心数据锁住
Pro自适应进阶、周复盘、现实重排、语音、深度趋势、轻营养年费 ¥168 / ¥228 / ¥298 做真实 A/B验证用户为“少思考 + 稳定进步”付费
教练协作计划审阅、异步视频/消息、周报后续按教练或服务定价高风险/高价值案例升级给人

价格是实验区间,不是最终报价;先验证年费,再考虑月费。不要用连续免费试用掩盖价值不足。

什么能成为壁垒

  1. 个体响应数据

    建议 → 用户选择 → 实际执行 → 后续表现的闭环,且按动作、器械、训练水平和生活约束分层。

  2. 动作与器械知识图谱

    不是百科文本,而是替代关系、设备差异、个人换算和不确定性。

  3. 信任与可迁移

    透明、可撤销、可导入导出看似削弱锁定,长期却减少采用风险,形成品牌。

  4. 训练中体验细节

    三秒完成一组、不会丢数据、异常场景不断流,这些需要大量真实训练打磨,不能靠模型 API 一夜复制。

推断基础模型、拍照识别和聊天 UI 都会商品化;把它们当壁垒是危险的。壁垒只能来自高质量纵向数据、受审核的决策系统和长期信任。

Risk register

主要风险,以及何时应该停止

风险早期信号缓解停止/转向条件
记录器没有代差用户仍回到训记/Hevy/表格现场观察、迁移、三秒组记录、稳定性优先4 周后核心用户的主记录迁移率 <50%
不信任自动建议高覆盖、关闭自动化、解释仍无效候选式建议、一次改一项、专家模板合格建议采纳/轻改持续 <35%
数据太稀疏RIR、体重、原因缺失,模型无法区分默认值、最小输入、置信度和冷启动规则强迫输入才能有价值,导致留存显著下降
营养拖垮团队大量食物纠错和客服,训练留存无提升三档模式、第三方数据、区间表达营养用户 8 周留存/结果无增益,就保持外接
视觉承诺过大光照/遮挡下误判,用户把反馈当诊断逐动作验证、质量门、主动弃权教练标注集上达不到预设准确与弃权安全阈值
巨头快速复制训记/Keep 上线相同卡片和进阶更深的组级闭环、开放迁移、本地器械图谱用户认为现有免费方案“完全足够”且迁移意愿低
合规/责任不可承受需处理超出能力的特殊人群或敏感数据缩小定位、最小化、专家与法律审查核心价值必须依赖医疗宣称或无法取得合规数据
总停止条件:如果在 8 周真实使用后,用户只是觉得“更好看、更智能”,却没有把它作为主训练记录、没有采纳/修改决策,也没有减少训练前后的思考时间,就不应继续加营养、社交或视觉功能。要么回到记录体验,要么转成教练端工具。
Decision log

最终取舍清单

产品本质
可解释的训练决策系统;记录器是入口,AI 是能力,不是品类名。
首发用户
中国商业健身房的规律力量训练者;居家与零基础后置。
训练记录
必须做,而且要做到行业一线水平;不因“有 AI”降低基础体验标准。
饮食记录
做轻闭环和三档精度;不首建全量食物库,不默认要求每日精确记录。
餐单
给约束模板、份量和替换,不给僵硬的七日照抄菜单。
动作库
60 个高频高质量条目起步;重点是上下文提示和替代图谱,不是数量。
LLM
解析、解释、总结与异常对话;负荷和安全由结构化引擎约束。
视觉 AI
后置,按动作逐个验证;低置信度必须放弃,不做伤病诊断。
商业化
免费可靠记录 + 年费 Pro;不做低价终身 AI;教练协作后置。
胜负标准
第 8 周仍是主记录器,建议被理解并采纳/修改,用户减少决策时间且表现趋势不变差。

从明天开始的前三步

  1. 写一页招募问卷,找到 10 名训记/Hevy/表格的真实重度记录者;不要先找“对健身有兴趣”的泛用户。
  2. 做一个只有“上次—目标—本次—为什么”的训练组原型,带去健身房现场测点击、误触和注意力。
  3. 由教练人工在后台给出两周建议,验证用户是否在乎并信任“下一步”,再决定算法与模型投入。
References

来源与参考

优先列官方产品页、应用商店、企业披露与同行评审研究。评论用于发现问题,不代表总体样本;厂商用户量与功能效果为自述。

  1. 中华人民共和国个人信息保护法,尤其第二十八至三十条。中国网信网 / 法律全文
  2. 生成式人工智能服务管理暂行办法中国网信网 / 官方规定
  3. 互联网信息服务算法推荐管理规定中国网信网 / 官方规定
  4. Health Connect data types:训练会话、计划训练、营养、睡眠等。Android 官方文档
  5. Keep:AI 运动教练App Store 产品页 / 厂商描述与动态价格
  6. Keep Inc. 2025 Annual Results香港交易所公司披露;使用数据为公司口径
  7. 训记—训练计划专家中国 App Store 产品页、版本记录与精选评论
  8. 薄荷健康中国 App Store 产品页 / 厂商描述
  9. 硬汗健身中国 App Store 产品页与评论线索
  10. Strong Workout Tracker Gym LogGoogle Play 产品页
  11. Hevy features;另见 pricing厂商官方页
  12. Fitbod Help Center;另见 Google Play 产品页厂商官方帮助与商店描述
  13. Alpha Progression厂商官方页
  14. Boostcamp厂商官方页;规模数字为厂商口径
  15. RP Strength / RP Hypertrophy;另见 Google Play厂商官方页与商店描述
  16. MacroFactor AI Food Logging厂商官方设计说明
  17. MyFitnessPal: Calorie CounterGoogle Play 产品页 / 数据量为厂商口径
  18. Cronometer厂商官方页
  19. Eat This Much — Meal PlannerGoogle Play 产品页
  20. Zing AI: Home & Gym WorkoutsGoogle Play 产品页与评论线索
  21. Freeletics厂商官方页;规模数字为厂商口径
  22. Caliber;另见 Google Play厂商官方页与商店描述
  23. Trainerize厂商官方页;规模数字为厂商口径
  24. Cora Health;另见 Y Combinator company profile厂商与投资机构产品说明
  25. GymStreak: AI Personal TrainerGoogle Play 产品页
  26. Fitbod App Store reviews用户评论样本,仅作方向性线索
  27. Keep 中国 App Store reviews用户评论样本,仅作方向性线索
返回顶部 ↑