DataInfra-RedactionEverything 未来 roadmap:即将推出的新功能预览
【免费下载链接】DataInfra-RedactionEverythingDataInfra Series. Redact EVERYTHING with local llms and vlms.项目地址: https://gitcode.com/gh_mirrors/da/DataInfra-RedactionEverything
DataInfra-RedactionEverything 是一款基于本地大语言模型(LLM)和视觉语言模型(VLM)的全能数据脱敏解决方案。随着隐私保护需求的不断增长,项目团队正积极开发多项核心功能升级,以下是即将推出的全新特性预览。
1. 智能几何分析引擎:提升复杂文档处理能力
未来版本将重点强化视觉处理模块,通过纯几何分析引擎实现更精准的文本区域识别。该功能将解决复杂排版文档(如多栏布局、表格混排)的脱敏难题,目前开发团队已在 backend/app/services/vision_service.py 中完成核心算法设计,正在进行GPU加速适配。
图:结构化文档处理界面将支持更精细的区域划分与识别
2. CJK文字优化:增强东亚语言处理能力
针对中文、日文、韩文等东亚语言的特性,开发团队正在 backend/app/services/vision/ocr_cjk_geometry.py 中开发专用优化模块。新功能将通过:
- 垂直文本检测与识别
- 汉字笔画特征分析
- 东亚排版规则适配
显著提升多语言文档的脱敏准确率,计划在下个版本与NER服务完成集成。
3. 批处理工作流升级:支持全流程自动化
批处理功能将迎来重大升级,新增智能任务调度系统和失败任务自动重试机制。用户可通过 backend/app/services/task_queue_pipelines.py 配置自定义工作流,实现从文件上传、识别到导出的全流程自动化。
图:全新批处理中心将支持任务优先级设置与进度可视化
4. 结构化数据脱敏:打通数据库直连通道
开发团队正在扩展对结构化数据的支持,计划通过 backend/app/services/structured_connections.py 实现:
- 主流数据库直连(MySQL/PostgreSQL/MongoDB)
- 动态脱敏规则配置
- 脱敏结果实时同步
用户可在 docs/manual/structured-delivery.png 界面预览数据流转全链路,确保脱敏过程可追溯。
5. 性能优化:GPU资源智能调度
为提升大文件处理效率,新功能将引入GPU内存动态分配机制。通过 backend/app/core/gpu_memory.py 实现:
- 多模型并行推理
- 显存使用阈值预警
- 任务优先级资源调度
双GPU环境下(如部署方案 deploy/dual-5090/)可实现300%的吞吐量提升。
如何获取最新功能?
- 克隆仓库:
git clone https://gitcode.com/gh_mirrors/da/DataInfra-RedactionEverything - 关注 docs/audit-20260706.md 中的更新日志
- 通过 frontend/src/features/settings/ 界面开启测试功能开关
项目团队欢迎社区贡献者参与功能测试,可通过 e2e/ 目录下的测试脚本提交反馈。让我们共同打造更强大的数据脱敏工具! 🚀
【免费下载链接】DataInfra-RedactionEverythingDataInfra Series. Redact EVERYTHING with local llms and vlms.项目地址: https://gitcode.com/gh_mirrors/da/DataInfra-RedactionEverything
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考