kaixin_啊啊
08-10·创新乐知员工
办公助手榜:AI 提效秘籍任务
飞书抓不到正文,Codex自己写脚本
一个93万字符的飞书页面,Codex最后只留下了正文。今天处理一份公开飞书文档时,我顺手看了一下Codex遇到动态页面会怎么办。链接在浏览器里可以打开,常规网页读取却没有拿到正文。Codex改用PowerShell请求原页面,状态码200,返回的HTML共有935124个字符。里面大部分是脚本、页面配置和推荐信息。它没有继续硬读整页,而是在源码中找到承载可见文字的data-string节点,临时写了一段提取脚本,随后处理HTML编码、零宽字符和重复文本。第一次结果里有一个表格单元格缺值。Codex重新定位这段文字在源码中的位置,把附近几个单元格单独提取了一遍,缺失内容就补齐了。最终输出只剩几十行正文。标题、段落和表格数据都能直接复制。我只描述了想要的结果,页面结构和临时脚本由它处理。遇到类似页面,可以把下面这段要求交给AI。「读取这个公开或已授权访问的文档链接。常规方式拿不到正文时,检查页面源码中承载可见文本的节点,写一个尽量短的脚本提取并去重。核对标题、列表和表格是否缺失,最后输出干净文本。不要尝试绕过登录或访问权限。」这类小任务很适合检验AI编程工具。代码本身很短,工具还要发现哪里没读全,并继续查那个空掉的表格单元格。
发布于 河南
分享
评论
3
未登录
友善发言
image-upload
评论
加载中