上周部门接了30条账号的周更KPI实习生用AI批量生成的文案全卡在了平台原创审核扣了3个账号的健康分。紧急拉了两个转运营的开发一起搞自媒体文案降重赶在周五下班前把积压的内容全部过审摸出了一堆之前没人说透的实操细节。我实测出的3种百分百无效的自媒体文案降重操作最先踩的坑就是上来就堆同义词替换。 什么把“好看”换成“赏心悦目”把“好吃”换成“唇齿留香”改完读起来像十年前的八股文不说平台的原创检测根本不认。 我当时用BGE-small开源模型拉了个向量比对脚本把替换完的文案和原文做余弦相似度计算结果出来的数值差点把我眼镜吓掉改完1000字的文案相似度还在0.92以上等于白干。from sentence_transformers import SentenceTransformer import numpy as np model SentenceTransformer(BAAI/bge-small-zh-v1.5) def calc_semantic_similarity(text1: str, text2: str) - float: emb1 model.encode(text1, normalize_embeddingsTrue) emb2 model.encode(text2, normalize_embeddingsTrue) return float(np.dot(emb1, emb2)) # 实测同义词替换后的文案和AI原文相似度基本都在0.9以上 if __name__ __main__: raw_text 这款奶茶的茶底用的是福建高山乌龙入口有很明显的兰花香气 modified_text 该饮品的基底采用福建高山乌龙制作入口可以感受到显著的兰花香味 print(calc_semantic_similarity(raw_text, modified_text))后来不死心又试了网上传的“打乱段落顺序”法。 把一篇1200字的美食文案的6个段落全部拆出来用shuffle随机重排了20次相似度最低的那版也才降到0.81离平台要求的0.7的阈值差了十万八千里。 反而有几版打乱后的文案逻辑完全跳脱前半句还在说探店地址后半句直接跳到了试吃感受给运营的同事看了直摇头。最后试了公认最傻的“多轮翻译法”中文翻英文再翻回中文来回倒两遍。 出来的内容全是欧式长句什么“我非常同意这个产品在大多数情况下会给用户带来良好的体验”读着别扭就算了测出来的相似度还在0.78甚至有几篇AI特征比原文还明显。那两天测了快80篇不同方法改的文案最后总结出来一个核心现在主流内容平台的原创检测根本不是卡字符重复率卡的是三个底层维度语义向量相似度、停用词分布特征、句式熵值。 之前那些土方法全是在字符层面做改动根本碰不到这三个维度的阈值无效很正常。我们自己搭了个本地的初筛脚本不用把文案上传到平台触发风控本地跑一遍就能先卡一遍阈值核心代码放出来大家可以直接改了用import re import jieba from collections import Counter THRESHOLD { semantic_sim: 0.65, # 语义相似度留冗余比平台要求低0.05 avg_sent_len: 18, # 平均句长不能超过18字 stopword_ratio: 0.22 # 停用词占比波动不能超过0.22 } STOPWORDS set([line.strip() for line in open(stopwords.txt, encodingutf-8).readlines()]) def calc_text_features(text: str) - dict: sentences re.split(r[。\n], text) sentences [s for s in sentences if s.strip()] avg_len sum([len(s) for s in sentences]) / len(sentences) words jieba.lcut(text) stop_cnt sum([1 for w in words if w in STOPWORDS]) stop_ratio stop_cnt / len(words) return {avg_len: avg_len, stop_ratio: stop_ratio, pass: avg_len THRESHOLD[avg_sent_len] and stop_ratio THRESHOLD[stopword_ratio]}顺着这个逻辑我们摸出了一套效率最高的操作流程 第一步把AI生成的原文全部拆成单句不要按段落拆每一句单独做视角替换。比如原来的AI文案是“这款奶茶的茶底用的是福建高山乌龙”直接改成“我上周去门店点单的时候老板偷偷跟我说他们家茶底全是福建收的高山乌龙”每句加个只有你自己才知道的细碎小细节语义相似度直接就掉下来了。 第二步把所有超过20字的长句全部拆成两句中间加个换行。别担心格式乱自媒体文案本来就不兴大段长文字拆完之后读者看着反而轻松还能直接把平均句长的阈值卡下来。 第三步随机插入1-2句完全低信息的个人化碎句比如“上次我买的时候还送了个印着logo的小勺子”这种句子根本不可能出现在通用AI训练集里直接把停用词分布的特征打乱。改写完之后我习惯性地丢到团象AI检测里跑一遍确认检测率降到阈值以下再往下走。这段时间跑下来还发现了一个没人提的反常识细节降重的时候千万别乱加emoji。 我们之前找了120篇测试文案在里面插入3-5个不同的表情结果87篇的AI特征分反而比不加的时候更高。后来查了下开源的AIGC检测数据集才反应过来现在大部分AI生成内容的训练语料里就掺了大量带emoji的自媒体文案模型反而会把表情多的内容优先判定为AI生成。 就这一个细节直接把我们之前的过审率从60%拉到了80%。现在用这套流程实习生改一篇1000字的文案最多8分钟之前用同义词替换的方法要20分钟过审率还不到30%。上周30条积压的文案发出去之后只有2篇因为加的个人细节太少被打回微调之后直接过审被扣掉的3个账号的健康分一周之后就全回满了。中间还踩了个特别蠢的反向坑为了降重故意写错别字把“好用”写成“好yong”把“划算”写成“划蒜”。 结果平台的合规检测和原创检测是打通的这种故意写的谐音错别字直接会给文案打上低质标签之前有个同事改的一篇文案原创分拉满了发出去播放量直接卡死在97连基础流量池都没进纯纯白干。后来我们又把之前的初筛脚本优化了下用spaCy的依存句法分析把所有超过22字的长句自动标红提醒人工拆分省掉了手动找长句的步骤整体效率又提了30%。 现在这套流程跑了快两个月手上二十多号内容账号的文案过审率稳定在95%以上根本不用找什么第三方的付费降重接口本地跑个几十兆的小模型加5分钟人工干预完全够用。上周试了下把平均句长的阈值调到25字适配了几个做美妆账号的同事的文案风格最近正在跑一周的发布数据看会不会对原创分产生什么隐性影响。
企业数字化 ERP 产品动态
相关推荐
不会代码也能搞定:云服务器价格购买价格表与性能优化实操指南 不会代码也能搞定:云服务器价格购买价格表与性能优化实操指南 自己不会代码想做网站,这是很多创业者最初的噩梦。你看着那些复杂的代码界面,心里发慌,怕选错服务器导致网站打不开,更怕花钱买了一堆用不上的配置。其实,搞定云服务器价格购买价格表的核心… · 2026/9/27 2:40:33
公司网站建设意义与免费工具实操指南 公司网站建设意义与免费工具实操指南 上周三下午五点,我盯着后台那个“改个按钮颜色”的需求单,心里直犯嘀咕。建站公司的人说“排期中,预计下周”,这都拖了一周了。客户在电话里急得冒烟,说再不改就要扣款。我叹了口气,没等对方回复,直接打开本地环境… · 2026/9/27 2:40:33
多气体同步检测的时域编码策略:基于单光子IPDA激光雷达的技术进展 工业园区、城市管线和矿区的气体泄漏具有组分复杂、空间分布不确定的特点,单一气体检测方案难以满足实际预警需求。近年来,一种受傅里叶变换红外光谱学(FTIR)时域-频域转换原理启发的时域重叠光谱技术被提出并实验验证,该技术利用单光子探测器和可重构光路,在单次扫描周期… · 2026/9/27 2:39:51
消费品BI选型PoC设计:贴合核心业务场景的验证方案 导语
消费品行业正在从增量竞争转向存量竞争,越来越多企业希望通过BI搭建敏捷数据能力支撑精细化运营,但在选型过程中,PoC(概念验证)环节往往容易走形式,要么只测通用功能不贴合核心业务,要么没… · 2026/9/27 3:23:38
告别拖延症:网站优化知识速查手册,3步搞定核心瓶颈 告别拖延症:网站优化知识速查手册,3步搞定核心瓶颈 改个需求建站公司拖一周,后台数据跌得你心惊肉跳,这种憋屈感创业团队负责人最懂。别急着换供应商,很多时候不是人不行,是你没给对“说明书”。今天这份 网站优化知识… · 2026/9/27 3:23:38
朱雀仿宋笔形细节大赏:重心、中宫、撇捺与粗细对比的仿宋设计逻辑 朱雀仿宋笔形细节大赏:重心、中宫、撇捺与粗细对比的仿宋设计逻辑 【免费下载链接】朱雀仿宋 开源仿宋字库计划 项目地址: https://gitcode.com/TrionesType/zhuque
朱雀仿宋(Zhuque Fangsong)是璇玑造字推出的开源仿宋字体࿰… · 2026/9/27 3:23:38
商务网站建设实验报告怎么做?3步搞定性能优化避坑 商务网站建设实验报告怎么做?3步搞定性能优化避坑 手里拿着《商务网站建设实验报告》却一头雾水?别慌,这不仅是学生的作业,更是你转行做网站的敲门砖。很多新手卡在第一关: 自己不会代码想做网站… · 2026/9/27 3:23:38
海康设备GB/T28181对接实战:从注册失败到稳定运行的排查指南 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/27 3:23:20
MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现 简介:这套Matlab仿真工具完整呈现雷达信号脉冲压缩过程,从线性调频(LFM)信号生成、目标回波仿真到匹配滤波压缩处理均有可运行代码支撑,面向电子信息工程、计算机、数学等专业学生,适用于课程设计、期末大作… · 2026/9/27 0:00:01
汕头网站建设制作厂家避坑指南:5大注意事项救急 汕头网站建设制作厂家避坑指南:5大注意事项救急 改个需求建站公司拖一周,这种憋屈事我见得太多了。 很多汕头老板找本地建站团队,签合同前看着方案挺美,一上线就变脸。 今天不聊虚的,直接拆解找 汕头网站建设制作厂家 时的5个核心 注意事项… · 2026/9/27 0:00:01
多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习 简介:基于PyTorch的多模态虚假新闻检测项目完整代码包,面向自然语言处理与计算机视觉交叉方向的开发者、科研人员及毕业设计选题者,解决社交媒体中文本与图像联合识别虚假新闻的问题。系统以BERT预训练模型提取文本语义特征,以Res… · 2026/9/27 0:00:01
MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现 简介:这套Matlab仿真工具完整呈现雷达信号脉冲压缩过程,从线性调频(LFM)信号生成、目标回波仿真到匹配滤波压缩处理均有可运行代码支撑,面向电子信息工程、计算机、数学等专业学生,适用于课程设计、期末大作… · 2026/9/27 0:00:01
汕头网站建设制作厂家避坑指南:5大注意事项救急 汕头网站建设制作厂家避坑指南:5大注意事项救急 改个需求建站公司拖一周,这种憋屈事我见得太多了。 很多汕头老板找本地建站团队,签合同前看着方案挺美,一上线就变脸。 今天不聊虚的,直接拆解找 汕头网站建设制作厂家 时的5个核心 注意事项… · 2026/9/27 0:00:01
多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习 简介:基于PyTorch的多模态虚假新闻检测项目完整代码包,面向自然语言处理与计算机视觉交叉方向的开发者、科研人员及毕业设计选题者,解决社交媒体中文本与图像联合识别虚假新闻的问题。系统以BERT预训练模型提取文本语义特征,以Res… · 2026/9/27 0:00:01