fix: 第七轮深度搜索审计修复 — 20项
CI / backend (push) Canceled after 0s
CI / frontend (push) Canceled after 0s

- HIGH: isdecimal() → re.match() for PMID (non-ASCII digit crash)
- HIGH: boolean_operator 应用到字段分组和无标签词(AND/OR 错误)
- HIGH: Cursor 分页 pub_date 优先(article_date 导致数据错位)
- Parser: parse 异常处理器清理字段标签/布尔符/引号
- Parser: _parse_range date:year 反向交换(第4分支)
- Parser: MAX_TERMS 保护、TITLE/ABSTRACT 大写键补充
- Engine: best_match 排序剥离字段标签
- Engine: year_from/year_to is not None(年份=0 被 falsy 跳过)
- Engine: _single_term_condition SB 字段全量分发
- Engine: journal_tiers/nlm_subsets 空条件预警(0结果保障)
- Engine: ATM 展开和 _expand_mesh_tag_ids pass → logger.exception
- Engine: 降级 regex [\w/: -] 兼容 [MH:noexp] 冒号
- Frontend: syncSearchToUrl 移到 finally 块
- Frontend: 年份滑块/resetAllFilters 清除 URL 日期
- Frontend: Null cursor 日期安全守卫
- Docs: 新增 P7-1~P7-20 记录,测试数更新至 276
This commit is contained in:
34047007@qq.com
2026-07-27 13:01:52 +08:00
parent 4495ef9e0a
commit 62be0efb59
5 changed files with 200 additions and 29 deletions
+145 -2
View File
@@ -2,7 +2,7 @@
> 本文档按修复轮次详细记录所有搜索功能合规性修复的背景、根因分析和修改内容。
>
> **累计**6 轮,75 项修复,50+ 字段标签注册,248 项测试覆盖
> **累计**7 轮,95 项修复,50+ 字段标签注册,276 项测试覆盖
> **时间跨度**2026-07-24 ~ 2026-07-27
> **核心文件**`pubmed_query_parser.py`~730 行)→ `search_engine.py`~1320 行)
@@ -481,6 +481,146 @@
---
## 第七轮:第 7 轮深度审计修复(20 项)
**日期**2026-07-27
**数量**20 项(4 Agent 第 2 轮并行审计)
**触发**:用户"再次全面、深入地检查、分析,消除漏洞"
**测试**276 通过(新增 ~28 项),13 项预存失败
### P7-1: `isdecimal()` 非 ASCII 数字崩溃 PMID 检测(HIGH
- **文件**`search_engine.py` `search()` L245-246
- **问题**`str.isdecimal()` 对阿拉伯数字 U+0660 等返回 True,但 `int()` 不接受非 ASCII 数字 → `ValueError`,搜索返回 500
- **根因**Python 的 isdecimal() 包含 Unicode 数字字符,int() 只认 ASCII
- **修复**`t.isdecimal()` → `re.match(r'^\d{1,15}$', t)`
### P7-2: 降级 regex `[\w/: -]` 兼容冒号
- **文件**`search_engine.py` `search()` L219
- **问题**`[MH:noexp]` 标签中的冒号不在 `[\w/-]` 内,降级后冒号残留
- **根因**regex 缺少 `:` 和空格
- **修复**`[\w/-]` → `[\w/: -]`
### P7-3: Parse 异常处理器清除字段标签/布尔符/引号
- **文件**`pubmed_query_parser.py` `parse_pubmed_query()` L719-726
- **问题**:降级时 `query.strip().split()` 产生含 `"`、`[`、`]` 的碎片词,传递给 ATM 和 ILIKE 产生无意义匹配
- **根因**:降级路径未做任何清理
- **修复**:先用 regex 去掉 `[field]` 标签、AND/OR/NOT、引号和括号,再 split
### P7-4: `_parse_range` date:year 反向交换(第 4 分支)
- **文件**`pubmed_query_parser.py` `_parse_range()` L621
- **问题**`2026-06-01:2024[DP]` 开始日期、结束年份时未交换
- **根因**:缺少 `not _start_is_digit and _end_is_digit` 分支
- **修复**:增加第 4 分支处理 date:year 反向
### P7-5: `_pubmed_conditions` boolean_operator 应用到字段分组(HIGH
- **文件**`search_engine.py` `_pubmed_conditions()` L612, L635
- **问题**:字段分组(title、abstract 等)内全部用 `and_()` 组合,无视 `boolean_operator="or"`
- **根因**:字段分组硬编码 `and_()`
- **修复**:定义 `field_combine = or_ if boolean_operator=="or" else and_`
### P7-6: `_pubmed_conditions` boolean_operator 应用到无标签词(HIGH
- **文件**`search_engine.py` `_pubmed_conditions()` L652-659
- **问题**:纯文本词固定 AND,分开写的 `cancer OR tumor` 实际变 AND
- **根因**plain_conds 硬编码 `and_()`
- **修复**:全部改用 `field_combine`
### P7-7: best_match 排序剥离字段标签
- **文件**`search_engine.py` `search()` L497
- **问题**sort=="best_match" 时未剥离标签词,`[TI]` 参与 ts_rank 产生噪音
- **根因**:条件只检查 `sort == "relevance"`
- **修复**:改为 `sort in ("relevance", "best_match")`
### P7-8: year_from/year_to 精确空值检测
- **文件**`search_engine.py` `_pubmed_conditions()` L969-972
- **问题**`if pp.year_from:` 当 year_from=0 时 falsy → 条件跳过
- **根因**falsy 检测不适用于年份 0
- **修复**`if pp.year_from is not None`
### P7-9: `_single_term_condition` SB 字段全量分发
- **文件**`search_engine.py` `_single_term_condition()` L1100-1117
- **问题**:组内 SB 只有 nlm_subset 路径,PUBMED/MEDLINE/其他未处理
- **根因**:括号分组内调 `_single_term_condition`,与顶层分发不一致
- **修复**:复制顶层 SB 全量分发逻辑
### P7-10: journal_tiers/nlm_subsets 空条件预警
- **文件**`search_engine.py` `search()` L336-341, L388-393
- **问题**:筛选项匹配 0 个期刊时条件被跳过,用户收到全量结果而非 0 结果
- **根因**`if issns:` 保护,空→跳过
- **修复**:始终添加条件,空 ISSNS 时 0 结果 + `logger.warning`
### P7-11: ATM 展开异常日志化
- **文件**`search_engine.py` `search()` L287, `_pubmed_conditions()` L655
- **问题**flat text 和 pubmed 路径 ATM 异常都用裸 `except Exception: pass`
- **修复**:改为 `logger.exception()`
### P7-12: `_expand_mesh_tag_ids` 异常日志化
- **文件**`search_engine.py` `_expand_mesh_tag_ids()` L1239, L1276
- **问题**MeSH tag 查找和树展开的 `except Exception: pass`
- **修复**:改为 `logger.exception()`
### P7-13: 中文 name_zh ILIKE 加 LIMIT 100
- **文件**`query_expansion.py` `_find_mesh_tags()` L99
- **问题**:中文 name_zh ILIKE 无 LIMIT,常见词匹配数千标签
- **根因**:英文 name_en ILIKE 已有 LIMIT 100,中文忘记加
- **修复**`.limit(100)`
### P7-14: Cursor 分页使用 pub_date 优先(HIGH
- **文件**`SearchView.vue` L358
- **问题**sort 是 pub_date 降序,cursor 却用 article_date → 数据错位/丢失
- **修复**:改为 `pub_date || article_date`
### P7-15: Null cursor 日期安全守卫
- **文件**`SearchView.vue` L361-363
- **问题**:两个日期都为空时 cursor_date="" → `fromisoformat("")` ValueError → 静默回退 offset 分页
- **修复**`delete keysetCursors.value[p+1]` 当两日期都为空
### P7-16: syncSearchToUrl 移到 finally 块
- **文件**`SearchView.vue` L365, L373-376
- **问题**:搜索失败时 URL 状态不更新,下次搜索使用过时参数
- **修复**:移到 `finally` 块
### P7-17: 年份滑块清除 URL 日期
- **文件**`SearchView.vue` `onYearSliderChange()` L89
- **问题**:拖动年份滑块后 URL 残留 `date_from`/`date_to` 与滑块设置冲突
- **修复**:添加 `urlDateFrom.value=''; urlDateTo.value=''`
### P7-18: resetAllFilters 清除 URL 日期
- **文件**`SearchView.vue` `resetAllFilters()` L528
- **问题**:重置筛选后 urlDateFrom/urlDateTo 依然存在
- **修复**:添加 `urlDateFrom.value=''; urlDateTo.value=''`
### P7-19: MAX_TERMS 保护
- **文件**`pubmed_query_parser.py` `tokenise()`
- **问题**:超长查询(>200 token)产生过多字段条件,数据库超时
- **修复**:扫描到 `MAX_TERMS=200` 后截断并记录 warning
### P7-20: `_FIELD_TAG_MAP` 补充 `TITLE/ABSTRACT` 大写键
- **文件**`pubmed_query_parser.py` `_FIELD_TAG_MAP`
- **问题**:解析器 `.upper()` 产生 `"TITLE/ABSTRACT"` 但 map 只有 `"Title/Abstract"`
- **修复**:增加大写键
---
## 遗留限制
截至 2026-07-27,剩余 7 项已知限制:
@@ -504,4 +644,7 @@
| `test_pubmed_query_parser.py` | ~40 | tokeniser、解析器、语法正确性 |
| `test_pubmed_search_integration.py` | ~60 | 字段映射、API 集成、前端格式 |
| `test_comprehensive_verify.py` | ~27 | 字段完整、NOT 语义、括号、日期 |
| **合计** | **214** | 全部通过 |
| `test_comprehensive_verify.py` | ~55 | 第 7 轮新增覆盖(full dispatch、boolean_operator、cursor 等) |
| **合计** | **276** | 全部通过 |
> **预存失败(13 项)**9 项 `feed_engine` `StopAsyncIteration`(测试数据缺失) + 4 项 `pubmed_api` `_tag_article` import(函数已移入 pipeline