一个简洁、优雅且高效的 Hugo 主题

工具介绍:源码合并为 Word(去空行,软著专用)

本工具用于将多份源代码文件合并为一个 Word 文档,并在合并过程中自动去除空行、统一格式。支持输入页眉文本(每页顶部左对齐显示),适合在申请软件著作权时快速生成“排版规范、紧凑清晰”的源代码文档。

  • 功能要点:
    • 多文件合并(按文件名排序),可指定“起始文件”
    • 去除空行(仅空白字符的行也会删除)
    • 每个文件可选择是否从新页开始(分页)
    • 页眉文本左对齐显示于每页顶部
    • 统一格式:宋体(SimSun),字号 10 磅
    • 本地处理,不上传文件
  • 适用场景:
    • 软著申报时提交的源代码文档整理与排版
    • 将分散在多个文件中的示例代码合并为统一格式的文档
  • 直接打开工具:../static/tools/源码合并为Word(去空行).html

使用步骤:

  1. 打开工具页面,填写“页眉文本”(如“软件著作权-源代码文档”)。
  2. 拖拽或选择多个源文件,工具会按文件名排序;可在“起始文件”下拉中设定从哪个文件开始。
  3. 根据需要勾选“文件之间插入分页”,便于分卷阅读与审阅。
  4. 点击“生成 Word 文档”,完成后点击“下载生成的文档”保存。

提示:工具在浏览器端完成处理,适合隐私与合规要求较高的场景。*** End Patch***}ETwitterозяется. There was an error. Please try again.***}``` –>

工具介绍:ipynb 转 md(网页版)

本工具用于将 Jupyter Notebook(.ipynb)内容转化为 Markdown(.md)格式的网页版本,便于分享与发布。

  • 功能要点:浏览器端解析、生成 Markdown 文本
  • 适用场景:将 Notebook 内容迁移到博客/文档系统
  • 直接打开工具

使用方式:

  1. 打开工具页面,导入/粘贴 Notebook 内容
  2. 一键生成 Markdown 文本,复制后保存为 .md
  3. 可根据需要手动调整图片/代码块等细节

提示:该工具纯前端实现,适合快速转换与分发。

工具介绍:B萌动漫角色票数统计

本工具按分隔符 将输入文本拆分为多组,自动提取每组中的“角色名 数字票”并进行累加统计。

  • 功能要点:分组解析、角色票数累加、错误格式提醒、结果下载
  • 适用场景:B萌/角色票数统计、分组文档快速汇总
  • 直接打开工具

使用步骤:

  1. 将整段文本合并为一行,按 分割为多组
  2. 每组以“角色名 数字票”格式书写,如:雪之下雪乃 3票
  3. 点击“确认统计(累加)”,可多次输入累加结果
  4. 支持将统计结果导出为 txt

示例输入:

工具介绍:世萌数据统计

本工具用于统计文本中被 [[...]] 标记的内容出现频率,并支持检测 Voter Id 重复。

  • 功能要点:统计 [[标签]] 次数,检测并提醒重复的 Voter Id
  • 适用场景:世萌/票选类文本统计、结果汇总
  • 直接打开工具

使用步骤:

  1. 在输入框粘贴文本,包含 [[标签]] 格式
  2. 点击“确认统计”,工具会解析并汇总出现次数
  3. 如检测到重复 Voter Id 会提示并阻止累加
  4. 可一键下载统计结果为 txt 文件

示例输入:

删除-docx-空行工具脚本

本文介绍仓库内的脚本源代码文件,它可以自动删除 .docx 文档中的空段落,并在非空段落中合并连续换行(将多个连续换行替换为一个)。脚本同时会处理表格单元格内的段落。

本工具最初用于在申请软件著作权时,批量清理源代码文档中的空行,让提交给软著的源代码文档更加紧凑、排版整齐,方便审核和归档。

如果你不方便在本地安装 Python,也可以使用浏览器版工具:删除 DOCX 空行(网页版),直接在网页中选择 .docx 文件并下载清理后的文档。

主要功能

  • 删除文档正文中空的段落(完全没有可见字符的段落)。
  • 在非空段落中把连续的 \n 合并为单个 \n,避免多余的空行或换行符导致格式混乱。
  • 遍历文档内的表格,按单元格同样规则清理空段落并合并换行。
  • 提供简单的 Tkinter GUI,交互选择输入/输出文件路径,适合非命令行用户。

依赖

  • 使用 python-docx(包名 python-docx)来读写 Word 文档。仓库中的脚本示例使用 from docx import Document

安装

pip install python-docx

(如果要使用 live GUI,请确保当前 Python 环境包含 Tkinter。Windows 上自带标准 Python 通常包含 Tkinter。)

如何使用

  • 图形界面(推荐,脚本默认行为):

    • 运行脚本:

      python 原始内容文档/dele_null_line.py

    • 脚本会弹出文件选择对话框,请选择要处理的 .docx 文件,并指定输出文件名。

  • 作为模块调用(在其他脚本中复用函数):

    from 原始内容文档.dele_null_line import remove_empty_lines_from_docx remove_empty_lines_from_docx(‘input.docx’, ‘output.docx’)

实现要点(供维护者参考)

  • 段落处理:脚本先遍历 doc.paragraphs,把纯空的段落标记删除,非空段落使用正则 re.sub(r"\n+","\n", text) 合并连续换行。
  • 表格处理:进入每个 doc.tables,对每个单元格的 cell.paragraphs 做同样的清理与合并。
  • 删除操作:对要删除的段落或单元格段落,使用底层 XML 节点 ._element.getparent().remove(...) 执行删除,避免改变段落集合时引发索引问题(通过反向索引删除)。

示例场景

XVPN: Remote LAN for Creative Work

How I use an XVPN gateway to map a distant NAS as a local drive and collaborate as if on-site.

  • IPv6 direct connection, no relay, near–LAN speed
  • Map NAS as network drive; file transfer saturates home bandwidth
  • Low-latency review inside the same “virtual LAN”
  • L2 features help reach machines as if on the same switch

This article mirrors the Chinese version and summarizes the key takeaways for English readers.

在Excel中数据加工的好用方法

  • 项目背景:某公司开展员工满意度调查,回收问卷后得到原始数据,需要对原始数据进行清洗.
  • 数据规模:标注数据量1000条数据+6个维度、数据来源企业脱敏数据。
  • 项目周期:独立完成,耗时4h。
  • 数据处理:经过分析,该原始数据存在以下问题:
    1. 部分问卷的 “年龄” 字段为空值;
    2. “入职日期” 字段格式不一致(如 “2023-01”“2023 年 1 月”“2023/1”);
    3. 存在重复提交的问卷(同一员工提交了 2 次);
  • 处理方法
    1. 插入数据透视表,以"部门"为行,以"年龄为值"统计每个部门平均年龄; 用Excel的筛选功能,筛选出"年龄"为空的行,再筛选出“部门”为“销售部”的行,统一填入销售部的平均年龄。如此可以快速填充缺失值。
    2. 通过 “拆分格式→文本转换→汇总统一→转日期类型” 的流程,将混乱的多格式日期,逐步规范为统一的日期值: 拆分格式:为每种日期格式建列,明确处理对象; 文本转换:用 IF+MID 把不同格式转成统一文本(如 YYYY-MM-DD 文本); 汇总统一:用 IF 合并结果,确保每行一个统一文本; 转日期:用 DATE+MID 将文本转为真正的日期类型(可参与日期计算)。 (注:步骤 2 中 IF 返回的 0 需注意过滤,避免影响后续转换;函数操作在 Excel、Google Sheets 等工具中通用,语法略有差异时需调整。)
    3. 用Excel的“删除重复项”功能,将重复提交的问卷删除。

1️⃣. 对每一种日期格式添加一个列 目的:先梳理数据中存在的日期格式(如 YYYY-MM-DD、MM/DD/YYYY、DD.MM.YYYY 等),为每种格式单独建列。 作用:方便后续针对不同格式的字符串,分别提取年、月、日信息。

2️⃣. 使用 IF 结合 MID,转化为目标格式的常规文本(false 忽略会返回 0) 逻辑:

在Excel中清洗数据的好用方法2

  • 项目背景:某电商平台收集了用户订单数据,存在以下问题:
  1. 重复数据:同一用户 ID 出现多次相同订单(订单号重复)。
  2. 缺失数据:部分订单的 “支付时间” 字段为空。
  3. 逻辑错误:“订单金额” 字段出现负数(如 - 50 元),“商品数量” 字段出现 0 件。
  • 数据规模:标注数据量:115条,7维度、数据来源:模拟数据.
  • 项目周期:1h
  • 数据处理
  1. 选中 “订单号” 列,使用 “数据→删除重复项”,勾选 “订单号”,删除完全重复的订单记录。
  1. 通过 “数据→筛选” 选中所有 “支付时间” 为空的单元格。
  2. 计数筛选出的单元格数量.方法⑴:框选一列,然后看Excel底部状态栏的统计数据;方法⑵:找一个空单元格,使用“分类汇总” 函数计数**=SUBTOTAL(3,A:A)-1**.(3 对应的名称是 COUNTA(非空单元格个数))
  3. 鉴于支付时间缺失比例达13%,而又比较重要,手动填充合理时间(订单创建时间+12h(支付和创建订单的平均间隔时间))
  1. 列出可能的逻辑错误,如 “订单金额 < 0” 或 “商品数量 = 0” 的单元格.
  2. 使用"筛选"功能,筛选出"商品数量<=0"的单元格,然后删除掉这些行.
  3. 使用"筛选"功能,筛选出"订单金额<0"的单元格.
  4. 核对错误数据:若为录入错误,修正为正确值(如 - 50 元改为 50 元);若为无效数据,删除对应记录。