影刀RPA文本数据提取方法三:指令提取
影刀RPA文本数据提取方法三指令提取作者林焱 | 适合人群不会正则也不会JSON但需要用影刀内置指令处理文本的新手什么情况用什么你从网页上抓了一段文本要从中提取特定内容但不会写正则数据也不是JSON格式。影刀RPA提供了一组文本处理指令可以不用写代码就完成大部分文本提取任务。什么情况用指令提取要提取的内容有固定前缀或后缀比如价格99元里的99要做字符串替换、拼接、截取要判断文本是否包含某个关键词你不会正则也不想学怎么做核心指令一览指令功能例子查找文本返回关键词在字符串里的位置找价格的位置截取文本按位置截取一段字符串从第5个字符开始取10个替换文本把A替换成B把替换成分割文本按分隔符切成列表按,“分割a,b,c”去除空白字符去掉首尾空格清洗用户输入案例1提取价格99元里的数字步骤「查找文本」→ 在价格99元里找的位置 → 返回2「查找文本」→ 找元的位置 → 返回5「截取文本」→ 从第3个字符开始取2个字符 → “99”拼多多店群自动化报活动上架更简单的做法5. 「替换文本」→ 把价格“替换成” → “99元”6. 「替换文本」→ 把元替换成 → “99”案例2从URL里提取参数值URLhttps://www.taobao.com/item.htm?id123456typenormal目标提取id参数的值123456步骤「分割文本」→ 按?分割 → 取后面一段id123456typenormal「分割文本」→ 按分割 → 取第一段id123456「分割文本」→ 按分割 → 取第二段123456案例3批量清洗手机号去掉空格和横线文本列表[138 0013 8000, 139-0013-9000, 13800138000]用「ForEach」循环每次处理一个「替换文本」→ 替换空格成「替换文本」→ 替换横线成保存到清洗后的列表有什么坑坑1查找文本返回的位置是从0开始还是从1开始影刀的「查找文本」指令返回的位置是从1开始的不是从0。比如价格99元价的位置是1“格是2”是3。如果你用其他语言比如Python处理文本位置是从0开始的。两边混用时要注意。坑2截取文本的位置和长度要算清楚「截取文本」指令有两个参数起始位置从1开始截取长度如果你想取价格99元里的99起始位置4“价”1“格”2“”3所以数字从4开始截取长度2如果截取到末尾长度参数可以填一个很大的数比如9999影刀会自动截取到末尾。坑3分割文本后取某一段要注意索引「分割文本」返回的是一个列表。比如a,b,c按,分割成[a,b,c]。取第一段分割结果[0]影刀里列表索引从0开始取最后一段分割结果[分割结果.size-1]TEMU店群矩阵自动化运营核价报活动坑4替换文本是区分大小写的「替换文本」指令默认区分大小写。比如把apple替换成banana不会匹配Apple或APPLE。如果不想区分大小写需要先「转小写」或「转大写」再做替换。坑5去除空白字符只去掉首尾中间的去不掉「去除空白字符」指令只去掉字符串开头和结尾的空格、换行、Tab。中间的空格去不掉。如果想去掉所有空格用「替换文本」把空格替换成空字符串。总结指令提取适合简单的、格式固定的文本处理任务。如果格式不固定比如价格有时是99元有时是99.00还是要用正则或Python。三种文本提取方法怎么选格式固定 → 用指令提取最简单有固定模式但不固定格式 → 用正则提取最灵活数据在JSON里 → 用JSON解析最快下一篇讲文本数据提取方法四Python字符串处理应对那些指令和正则都搞不定的复杂场景。作者林焱