-
Notifications
You must be signed in to change notification settings - Fork 4
Expand file tree
/
Copy pathenv.example
More file actions
121 lines (109 loc) · 5.79 KB
/
Copy pathenv.example
File metadata and controls
121 lines (109 loc) · 5.79 KB
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
104
105
106
107
108
109
110
111
112
113
114
115
116
117
118
119
120
121
# Paper Digest 环境变量配置示例
# 复制此文件为 .env 并填入你的真实值
# ==================== 抓取/筛选/分析必需配置 ====================
# Paper Digest 分析配置(AI 分析论文用)
# 主模型(文本分析,必填)
PAPER_ANALYZER_API_KEY=your-api-key-here
PAPER_ANALYZER_MODEL=kimi-for-coding
PAPER_ANALYZER_ENDPOINT=https://api.kimi.com/coding/v1
# 副模型(多模态图像分析,可选)
# 不设置则不分析图片,主模型仅做纯文本分析
# 设置后:主模型做纯文本分析,副模型只筛选高价值图片并生成插图位置、图前 lead 和图后 explanation
# 副模型不得替换主模型原句;代码会忽略旧 replacement/rewrite 字段
# 未设置的 endpoint/key 默认复用主模型对应的值
# PAPER_ANALYZER_SECONDARY_MODEL=gpt-4o
# PAPER_ANALYZER_SECONDARY_ENDPOINT=https://api.openai.com/v1
# PAPER_ANALYZER_SECONDARY_API_KEY=sk-your-key
# ==================== 发布渠道配置(按需启用) ====================
# 微信公众号配置(仅发布到公众号时必需)
WECHAT_APP_ID=your-wechat-app-id
WECHAT_APP_SECRET=your-wechat-app-secret
WECHAT_THUMB_MEDIA_ID=your-thumb-media-id
PAPER_DIGEST_AUTHOR=your-name
# 飞书配置(仅发布到飞书时必需)
FEISHU_APP_ID=your-feishu-app-id
FEISHU_APP_SECRET=your-feishu-app-secret
# Blog 发布配置(博客发布必需;全流程抓取时也用于博客已发布论文去重)
PAPER_DIGEST_BLOG_REPO=~/code/github_repos/audio-paper-digest-blog
# 独立论文页三层 review 并发度(汇总页仍先串行审查)
# PD_BLOG_REVIEW_CONCURRENCY=5
# TOP N 一句话生成并发度,范围 1-5
# PD_XIAOHONGSHU_ONELINER_CONCURRENCY=5
PAPER_DIGEST_BLOG_BASE_PATH=/audio-paper-digest-blog
PAPER_DIGEST_BLOG_URL=https://nanless.github.io/audio-paper-digest-blog/posts
PAPER_DIGEST_GITHUB_REMOTE=origin
PAPER_DIGEST_REPO_URL=github.com/nanless/audio-paper-digest
# ==================== 可选配置 ====================
# 并发和重试(保持默认并发 3;可按 API 配额上调,不要为了规避代码错误而降并发)
# PD_ANALYSIS_CONCURRENCY=3
# PD_ANALYSIS_MAX_RETRIES=2
# 单次分析内部每个 LLM API 阶段的最大尝试次数(区别于整篇 PD_ANALYSIS_MAX_RETRIES)
# PD_ANALYSIS_API_MAX_RETRIES=3
# 审校/表格/方法/结构修复输出上限
# PD_ANALYSIS_REPAIR_MAX_TOKENS=16000
# 分阶段输入证据预算(字符数):默认主分析 200000;后处理只发送任务相关切片
# PD_ANALYSIS_FULL_TEXT_MAX_CHARS=200000
# PD_OPENSOURCE_EVIDENCE_MAX_CHARS=16000
# PD_REVISION_EVIDENCE_MAX_CHARS=60000
# PD_SCORING_EVIDENCE_MAX_CHARS=40000
# PD_REPAIR_EVIDENCE_MAX_CHARS=30000
# PD_STRUCTURE_EVIDENCE_MAX_CHARS=40000
# PD_REANALYZE_CONCURRENCY=3
# LLM 筛选每批篇数
# PD_FILTER_BATCH_SIZE=5
# LLM 前默认启用高召回关键词预筛;设为 0 可临时让全部候选直接进入 LLM
# PD_KEYWORD_PREFILTER_ENABLED=1
# arXiv 每类抓取数量
# PD_ARXIV_MAX_RESULTS=100
# arXiv 元数据抓取最多尝试次数、普通错误/429 退避基数与单类总等待预算
# PD_ARXIV_FETCH_MAX_RETRIES=5
# PD_ARXIV_FETCH_RETRY_BASE_DELAY_MS=5000
# PD_ARXIV_RATE_LIMIT_BASE_DELAY_MS=60000
# PD_ARXIV_FETCH_MAX_WAIT_MS=600000
# arXiv recent/search/abs/Atom 元数据请求绝对截止时间与响应字节上限
# PD_ARXIV_METADATA_TIMEOUT_MS=60000
# PD_ARXIV_METADATA_MAX_BYTES=8388608
# 可选固定 User-Agent;未设置时使用 config.js 内置轮换池
# PD_ARXIV_USER_AGENT=paper-digest/1.0
# 深度分析单张图片原始字节上限
# PD_IMAGE_MAX_BYTES=6291456
# 副模型每篇默认最多实际插入 4 张高价值图片;可用正整数覆写
# PD_IMAGE_INSERTION_MAX=4
# 单张图片 base64 字符上限
# PD_IMAGE_MAX_BASE64_CHARS=8388608
# 单篇论文所有图片 base64 总上限
# PD_IMAGE_TOTAL_BASE64_CHARS=20971520
# arXiv 图床较慢时可调整单张图片下载超时(毫秒,默认 60000)
# PD_IMAGE_DOWNLOAD_TIMEOUT_MS=60000
# arXiv HTML/图片发现与 PDF 全文下载超时(毫秒)
# PD_ARXIV_FETCH_TIMEOUT_MS=60000
# PD_ARXIV_PDF_TIMEOUT_MS=180000
# PD_ARXIV_PDF_MAX_BYTES=52428800
# 单类 arXiv 遇到 HTTP 429 时的累计退避上限(毫秒,默认 120000)
# PD_ARXIV_RATE_LIMIT_MAX_WAIT_MS=120000
# 最终评分审计和副模型插图计划使用独立低温,降低重跑漂移
# PD_SCORING_AUDIT_TEMPERATURE=0.1
# PD_IMAGE_PLAN_TEMPERATURE=0.2
# 博客文本 review 默认每 8000 字一块,范围 4000-16000;增大可减少重复 prompt
# PD_BLOG_REVIEW_CHUNK_CHARS=8000
# 单次博客 LLM review 输出预算,范围 1000-16000;默认 4000,隐藏推理耗尽时只做一次纯 JSON 有界恢复(默认最高 8000)
# PD_BLOG_REVIEW_MAX_TOKENS=4000
# 本地确定性视觉调试渲染器使用的 CJK 字体绝对路径
# PD_VISUAL_CJK_FONT=/absolute/path/to/cjk-font.ttf
# 项目级抓取代理(必需)。只读取当前文件中的值,不继承 shell/IDE 代理,也不读取 macOS 系统代理。
# arXiv 的 Node 请求必须使用 HTTP CONNECT;HTTPS_PROXY 或 HTTP_PROXY 至少配置一项,且必须是 http(s):// 地址。
# HuggingFace 的 curl 也会继承这两个变量;若代理同时提供 SOCKS,可额外设置 ALL_PROXY。
# LLM 请求始终 agent:false 直连,不会使用这些代理变量。
# HTTPS_PROXY=http://127.0.0.1:7897
# HTTP_PROXY=http://127.0.0.1:7897
# ALL_PROXY=socks5h://127.0.0.1:7897
# NO_PROXY=localhost,127.0.0.1
# 文件日志默认开启,输出 UTF-8 纯文本到 logs/,不限制数量或体积且不自动清理
# 兼容旧变量:PAPER_DIGEST_ENABLE_FILE_LOGS=1 或 PD_ENABLE_FILE_LOGS=1
# PAPER_DIGEST_ENABLE_FILE_LOGS=1
# PD_ENABLE_FILE_LOGS=1
# 仅在明确不需要文件日志时取消下一行注释
# PAPER_DIGEST_DISABLE_FILE_LOGS=1
# PD_DISABLE_FILE_LOGS=1
# 小红书 Cookie(JSON 格式 base64 编码,用于发布到小红书)
XIAOHONGSHU_COOKIES=