设置

关灯

第13章 空手套白狼(第2节)

c搬到餐桌上,打开电脑,打开邮箱,打开文档。

“...候选程序数量、可见测试通过率和策略覆盖度是三件不同的事。模型可以通过大规模采样制造出数量上的繁荣,却仍然在少数失败族里打转...”

这是直指AlphaCode的漏洞啊,尼克思忖。

他继续往下看,数据格式写得很具体。

每个训练样本从题目描述、候选程序到隐含的假设、失败边界、最小反例等等无所不包。

尼克看到这里,第一反应是麻烦,第二反应是新的数据设置方案大概率有用。

他开始按文档搭最小验证环境。

伊戈尔·巴布什金给他的限制很明确:不用内部敏感数据,不碰生产系统,不动AlphaCode主流程,只用公开题目和小规模候选程序集。

伊戈尔之所以会这样选,是因为他不想被谷歌发现。

他还想拿着这个模型在谷歌和推特两家之间待价而沽呢。

尼克从公开竞赛题里挑了一批结构清楚的题,按文档要求整理候选程序,把其中一部分错误解法标上失败原因,再用脚本生成针对性的反例探针。

一开始他还有点不耐烦,因为这东西过于手工。

指标漂亮当然是好事。

但前提是,漂亮的指标得是模型自发生成的。

而不是事先知道我要什么样的指标,故意设置甚至是手工修剪出来的指标。

为什么未来华国的模型在测试表现上和阿美莉卡的模型差不多,但使用体验却有明显差距。

就是因为针对测试的指标,进行的人工修剪成分过多了。

来自老板的文档里提前标注了:第一轮要证明失败家族这个变量是否能提供额外信息。

如果这个变量在小规模手工标注里都没有价值,那就没有必要专门写程序把它给自动化。

第一天他跑完第一组基线,普通采样加可见测试过滤后,候选程

本章未完,请点击"下一页"继续阅读! 第2页 / 共4页