模型 · 面向设计师

读全部评论,而非抽样

一个木炭色的扇形架子,放着许多细长的象牙色纸片,其中三张被抽到前面,中间还夹着一张琥珀色玻璃片
由从许多纸片中抽出的少数几张获得灵感的原创抽象编辑插画。

帖子表现很好。一个周末下来收到两百条回复。周一有人滚动十分钟,回答了碰巧看到的四条,然后关掉标签页。在未读的那堆里,某个客户在问银行节假日是否营业,还有一条关于订单的投诉,它将会变成一条评价。

没人选择这个结果。这只是在读完所有内容要花一小时、读完部分只要十分钟时发生的事。一个 2026年9月15日 发布的模型改变了阅读的成本,也就改变了选择。Ciyo 无法运行 Jev —— 它不生成图像也不生成视频,也不出现在我们的任何一个模型注册表里 —— 但这正是营销一周里最明显适合它的工作。

为什么评论恰好契合这种工具的形状

评论很短,它是文本,而你需要从中得到的,是少数几个是/否的事实,而不是一篇长文。这三个特性就是全部的规格。

这类模型只读文本 —— TypeSafe 的文档说,输入必须是字符串、JSON 对象或文本值组成的数组,而且图像目前还不支持。对于评论串来说,这条边界几乎不花你什么代价,不像几乎其他所有创意工作。

而你想要答案的那些问题,在你读之前就已经定好了:这是不是投诉,有没有人在等回复,这是不是辱骂,它讲的是什么,有多紧急。你不是在找洞见。你是在排序。

值得对每条回复问的问题

五个窄问题胜过一个大问题,而且它们针对同一条评论一起被评估,所以问五个比问一个多花不了多少。

一张表,列出要对每条评论问的五个带类型的问题、它们的类型,以及每个为什么重要
一次调用,输入一条评论,输出五个答案。Ciyo 制图。

当核查全部变得负担得起时,改变了什么

已公布的单价是每百万输入 token 0.042 美元,输出免费,问一条评论五个问题只花不到一美分的一点点。一家小生意一个月的回复,比一杯咖啡还便宜。

重要的改变不是钱,而是哪些评论被看到。周一一个疲惫的人读过的 5% 抽样就是现状。在任何人在标签页打开之前,每条评论都已排好序,那是另一种运作方式。

而且排序也变了。平台展示回复的方式是按最新优先,这重要性和它毫无关系;取而代之,你打开一个队列,投诉和未回答的问题排在顶端。

两根条形,比较手工读 5% 抽样与给每条评论问同样的五个问题
同一笔预算,两种花法。Ciyo 制图。

别让它回复任何人

这句话值得直说,因为那是人们最先伸手去做的,而那是用错了。

决策模型不会写。它返回一个类别、一个分数或一个数字,别的什么都没有。没有句子可发。如果你想要自动回复,你要的是另一种模型,而且你应该认真想想你到底要不要。

它做的是决定谁该得到人工回复、以什么顺序。这是更小的承诺,却是好得多的承诺:客户仍然从一个人那里得到答复,而那个人把时间花在需要它的四十条评论上,而不是花在一百六十条不需要它的评论上。

周一排好的队列长什么样
分组装什么谁处理
今天回复关于订单的投诉,以及有人在等的提问人,第一件事
本周回复一般问题、营业时间、对产品的好奇人,有空时
隐藏辱骂与垃圾自动,高于高置信度
致谢赞美与被标记的朋友一个赞,或什么都不做,那样也行
有人看一下这个模型不确定的任何东西人,因为置信度低

让它能保持诚实的两条规则

在每个选择上都声明一个退出选项。一项 2026年9月20日 发布的、预先注册过的独立评测发现,当不存在“这些都不是”选项时,三十个超出范围的输入没有一个被标记:模型选了最近的已声明类别,并给它附上一个置信度。一条用别的语言写的评论、一个机器人、或者你的任何分组都没预料到的东西,会落到某个错误的地方,而且看起来已经定案。

并且按置信度路由,而不只是按答案。隐藏一条评论对客户来说是具有破坏性且不可逆的,所以它配得上高阈值;把它加进队列则不然。已公布的路由模式把低于 0.6 的任何东西放到人面前,把高代价决策上的自动动作留给 0.85 及以上。

读它藏起来的东西。每周一次,十分钟。一个一直判错的核查器,现在对所有东西都一直判错,而藏起来的那堆正是那个失败变得看不见的地方。

从哪里开始

取你自己账号上最近的两百条评论,用手工把它们分到你的分组里。要半小时,而且它是唯一有意义的基准测试。

边做边把分组的定义写下来。你会立刻遇到边界情形:“这很贵”是投诉还是看法,而被标记却没有文字的朋友算不算任何东西?

然后把问题跑过同样的这两百条并比较。如果它在投诉和未回答的问题上和你一致,它就在干活。如果不一致,通常的原因是你的定义没你想的那么清楚,而在你自动化任何东西之前知道这点很有用。

评论分流问题

它也能写回复吗?

不能。决策模型产生一个类别、一个分数或一个数字,别的什么都没有。它决定谁需要人工回复、以什么顺序;写的人仍然是人类。

它能读其他语言的评论吗?

准确度较低。TypeSafe 的文档说英语是主要的训练语言,而其他语言,包括 CJK 文字,都被接受但目前的准确度较低。

自动隐藏辱骂安全吗?

只有高于高置信度时才行,而且只有有人复查了被隐藏的内容才行。从客户的角度看,隐藏是不可逆的,所以它配得上和任何高代价动作相同的阈值。

Ciyo 做评论分流吗?

不做。Ciyo 是制作作品的画布,而不是社交收件箱,而且它不运行 Jev。这是一个值得理解的工作,不是 Ciyo 的功能。

继续阅读

Ciyo 写的是创意和智能体工具背后的模型,并测试它能运行的那些。