健康 Agent · 3 天试评
评分标准:飞书文档 revision 767 | 生产内容:revision 47 | 试评日期:2026-07-24 至 2026-07-26
—三天平均质量分
3 / 3底线通过
14逐条洞察
5标准缺口 / 待确认
结论先看
整体判断
- 三天均未发现足以触发隐私、正确可信或健康安全底线的明确问题,底线暂记“通过”。
- 质量分明显低于原内容展示的 75 / 77 / 75 分。主要差异来自:今日状态超过篇幅上限且没有主线;多数洞察只是复述数据或共现,没有形成新理解。
- 高心率与某场景“重叠”的内容重复较多,部分低价值内容占用了展示位置;建议多为“继续观察 / 留意变化”,个人针对性较弱。
- 07-26 漏掉“静坐做美甲时持续高心率”这一更值得解释的候选,却产出多条普通步行/骑行重叠,信息覆盖记 0 分。
本次评分边界
- 只依据两份文档中可见的内容,不额外假设原始数据正确。
- “信息覆盖全面”原则上需要独立参考洞察清单;07-24、07-25 因缺少该清单记 N/A。07-26 有文档内明确的重要遗漏,记 0。
- 页面没有顶部图标,故“分数与顶部图标一致”记 N/A。
- 原内容自带的 75 / 77 / 75 分只作为被评内容展示,不参与本次计算。
评分标准校验
以下不是生产内容问题,而是评分标准本身需要补齐或统一。
- 今日状态缺少“抓住重点”评分行。文档说“五个评测目标等权”,总分约束也把“抓住重点”列为核心价值项,但表格只定义了四类目标。为能试算,本次加入 建议新增“抓住重点”临时项。
- 关联性数量不一致。说明写“五个关联性评分项等权”,表格实际只有四项。当前无法知道缺失的是哪一项。
- 洞察计算示例与现行表格不一致。示例仍按“依据、边界、结论……”9 项计算,现行表格把正确可信收成“因果推断合理”1 项,应更新示例或恢复缺失项。
- 健康数据型洞察的“生活—身体关联”缺少档位。有环境数据,但某条高价值洞察本身只需讲健康变化时,当前标准既不适合判 0,也不满足“N/A:没有环境数据”。本次暂记 N/A,并标为 档位待确认。
- 信息覆盖缺少可操作输入。标准要求对照独立“参考洞察清单”,但生产内容文档未附该清单。建议将清单或生成方法设为评测必需输入,否则该项无法稳定复现。
建议新增“抓住重点”临时档位:2 分=准确抓住全日最重要发现并形成清楚主线;1 分=重点基本正确但普通或略分散;0 分=多个重点并列、突出次要信息或遮住更重要问题;N/A=数据不足以判断。
计算口径
今日状态 × 30% + 洞察 × 50% + 关联性 × 20%,再乘 50 转为百分制
- 今日状态按五个目标等权;“清晰易懂”“语言风格”先在目标内取平均。
- 每条洞察先对适用项取平均;多条再平均;最后为“平均质量 × 80% + 信息覆盖 × 20%”。信息覆盖为 N/A 时,本次临时将洞察权重全部给平均质量,并显式标记。
- N/A 不计入平均;任一适用项为 0 分时,总分最高 59 分。
- 三天整体总分为三天质量分的简单平均。