增加中文安全采集工作台、确定性结构化采集链、合规边界说明和五张功能截图。
部署要求:详见DEPLOYMENT_ZH.md;生产环境需HTTPS、认证、限流并按合规范围配置允许列表。
已知问题:外部模型与在线集成需自行配置;采集行为须获得授权。
以隔离浏览器读取动态网页,将页面内容整理为可查询、可预览和可导出的结构化数据,并支持按需接入本地或云端模型。
面向公开网页资料整理的浏览器级数据采集工具,支持动态页面、多页面读取、正文清洗、结构化字段提取和多格式导出。交付版增加完整简体中文安全工作台和访问允许列表,以真实本机公开商品目录验证4条、5字段数据采集链;模型为可选增强,不依赖外部模型也可完成确定性采集。
真实界面
共 5 张
Capabilities
数据运营人员、市场研究团队、Python开发者、AI应用团队及需要整理公开网页数据的企业。
适合公开行业资料调研、商品目录整理、内容运营归档、企业内部公开页面汇总,以及AI数据提取教学和原型验证。
隔离环境真实启动Patchright浏览器读取本机公开测试页,提取4条商品、5个字段,并验证总览、结构化表、页面预览、CSV与JSON导出;容器健康且浏览器错误为0。
只应采集有权访问和使用的数据;不得绕过登录、验证码或访问控制获取敏感信息。外部模型和Google Sheets能力需使用者自行配置凭据并承担相关服务成本。
部署难度
中等
最低配置
建议2核CPU、4GB内存、5GB可用磁盘;首次构建会安装隔离浏览器。
开源许可证
MIT
最后验证
2026-08-13
技术栈
授权说明
源码根目录为MIT许可证;使用、修改和分发时需保留原版权与许可证声明。
Release notes
1 个已发布版本
增加中文安全采集工作台、确定性结构化采集链、合规边界说明和五张功能截图。
部署要求:详见DEPLOYMENT_ZH.md;生产环境需HTTPS、认证、限流并按合规范围配置允许列表。
已知问题:外部模型与在线集成需自行配置;采集行为须获得授权。