主题
上传的数据去了哪:沙箱、脱敏、删除与公共知识库的边界
把一份问卷数据或病历表传给一个 AI 系统,最该问的是:它跑在哪、谁能看、模型看到多少、删了是不是真删。下面按数据的一生来答。
上传:落在任务自己的目录里
文件传上来后存在这个任务独占的目录,记 SHA-256,解析出文本做摘要和种子文献抽取。它不进资料库,不进任何共享层,只有你这个账号能访问。分享页不挂下载路由,访客拿不到原始数据。
扫描:个人信息列默认脱敏
上传时按列扫描数据集(只读前 200 行判断列类型)、按段扫描文档,识别:
- 值形态:手机号、邮箱、身份证号(带校验位验证)、银行卡号、ICD 诊断码
- 列名:姓名 / 患者 / 联系人、诊断 / 主诉 / 病史、手机 / 电话、身份证、银行卡等
命中的列在确认页列出来,样例已经打码(手机留前 3 后 4,身份证留前 4 后 4,姓名留首尾)。原始值不进过程记录。你选:
- 自动脱敏(默认):分析读取数据时把这些列换成带任务盐的哈希(
h_+ 12 位)。同一个值哈希相同,按人分组、去重、计数都不受影响;反过来推不回原值。原文件不改。 - 保留原样:记一条「用户选择保留个人信息列」的事件。
用户协议要求你对上传内容有合法权利;含国家秘密、商业秘密或未授权敏感个人信息的材料请不要上传。
分析:在没有网络的沙箱里跑
每个分析作业起一个临时容器:无网络、非 root、根文件系统只读、CPU / 内存 / 进程数限额、超时强杀、跑完即销毁。数据读入、产物(指标、图、脚本)上传都在容器外做,容器内的脚本连不到任何地方。免费任务的沙箱是 1 核 / 1.5GB / 10 分钟 / 20 万行,已购次数的任务是 2 核 / 3GB / 30 分钟 / 200 万行;超行数上限分层抽样,报告里会标注。
模型看到什么
发给大模型的是完成任务必需的文本:研究问题、文献标题与摘要、分析出来的统计结果、待写章节的素材。不发送账户信息,不发送原始数据行——数据统计在沙箱里完成后只传结果。模型服务在中国境内,隐私政策写明你的课题、材料、生成内容不用于训练任何模型。
原件随时能下
任务的材料行有下载:只有任务所有者能下,一律作为附件返回。文件已被清理时会提示「这个文件已不在服务器上」,而不是报错。
删除:删任务就删干净
删除任务是级联的:数据库行、上传文件、交付物、分析产物、过程记录、实验方案导出、缓存的网页正文一起删,对象存储里该任务的前缀整个清掉。不可恢复,列表页删除前会提示。任务完成 30 天后自动归档,归档只是列表分组,不删任何东西。
删除账户(设置 → 账户)会删掉全部任务和资料库私有层,见 账号与登录。
保留期限
- 过程记录里的模型输入 / 输出原文:免费任务 30 天,已购次数的任务 1 年,到期只删原文、留摘要。
- 检索时缓存的网页正文:30 天。
- 沙箱中间文件:7 天。
- 交易记录按法律要求保存。
公共知识库:你的东西不会进去
公共知识库只收公开渠道合法获得的学术资料(开放获取论文、预印本、机构网页、开放数据集),进库要过一道晋升门(来源、许可证、质量分级)。你的上传文件、研究任务、结论、过程记录都不在候选之列——上传条目在资料库里是私有层,许可证标为 user-upload,只有你能读。
分享报告是你主动的动作:生成链接(默认 30 天有效,可设密码,密码错 5 次锁 15 分钟)后访客能看报告正文、引用和作者署名,不含邮箱、ORCID 和过程记录。重新生成链接旧链接即失效。
全文只索引不展示
平台会尽量拿到文献全文,但能不能在站内读只看许可证:
| 情况 | 站内能读吗 | 你看到什么 |
|---|---|---|
| CC0 / CC-BY / CC-BY-SA / CC-BY-ND / 公有领域 | 能 | 站内阅读器打开全文 |
| 其它许可证或未知(含 CC-BY-NC 系列) | 不能 | 全文只用来检索和 AI 分析,命中片段附原文链接,点「原文」跳出去 |
| 你自己上传的 PDF | 能,仅你本人 | 私有层阅读 |
| 没拿到全文 | — | 摘要 + 链接 |
ND(禁止演绎)许可的文献不做改写式摘录。权利人可以通过「侵权投诉」页 https://scipepper.cn/takedown 要求条目退出公共层,收到后先隐藏再审核。
坑
- 脱敏发生在读取时,不改文件——下载回去的原件里个人信息还在。
- 「保留原样」之后分析产物和图里可能出现原始值,这些会进报告和数据包,导出前自己看一眼。
- 删除任务不影响资料库里你手动加入的文献;删资料库条目要去资料库页。
- 分享页是公开的:链接给了谁就谁能看,要收回就重新生成或关闭分享。