最近几天,又上线了一个AIGC工具站:Chat PDF AI
基于PDF的问答、摘要等。
这次搞这个,比较麻烦的事PDF的解析,因为这和部署有关。
方案一:使用pdfjs-dist
import * as pdfjsLib from 'pdfjs-dist'
pdfjsLib.GlobalWorkerOptions.workerSrc = `//cdnjs.cloudflare.com/ajax/libs/pdf.js/${pdfjsLib.version}/pdf.worker.min.mjs`
/*注意,这里要mjs,因为js是找不到的。*/
const fetchPdfContent = async (pdfSrc:string) => {
try {
// Use the proxy API to fetch the PDF
const proxyUrl = `/api/xxx?url=${encodeURIComponent(pdfSrc)}`
const pdf = await pdfjsLib.getDocument(proxyUrl).promise
let fullText = ''
for (let i = 1; i <= pdf.numPages; i++) {
const page = await pdf.getPage(i)
const textContent = await page.getTextContent()
const pageText = textContent.items.map((item: any) => item.str).join(' ')
fullText += pageText + '\n'
}
console.log(fullText)
setPdfContent(fullText)
}
这样是可以成功解析PDF的,但是部署到cloud flare就有问题了,因为cloudflare是不支持一些node内置的模块的,因为它是部署在边缘。所以部署时,会报错:大致的意识是:不能使用fs, http/https, url这几个node内置的东西。
方案二:unpdf
这是cloud flare推荐的方案。确实方便一些。关键代码:
import { getDocumentProxy, extractText} from "unpdf";
const fetchPdfContent = async (pdfSrc:string) => {
try {
// 使用代理API获取PDF内容
const proxyUrl = `/api/xxx?url=${encodeURIComponent(pdfSrc)}`
// 使用fetch获取PDF数据
const response = await fetch(proxyUrl);
const arrayBuffer = await response.arrayBuffer();
const pdf = await getDocumentProxy(new Uint8Array(arrayBuffer));
constdata = await extractText(pdf, {mergePages: true});
setPdfContent(data.text);
}
解析没有问题,但部署到cloud flare上依旧有问题。因为使用了getDocumentProxy, extractText这两个unpdf的模块,导致有个worker的大小超过了1M,在cloud flare上,worker超过1M就要付费。
这个unpdf,真不愧是cloud flare推荐的啊。
总结
最后,我把这个项目部署在了vercel上。
相关文章
Gemini:王者归来?
掉队近一年的Gemini突然动作频频:Gemini 4曝光、Antigravity集成Claude 5.5、Google收紧Gemini模型权限。免费版Gemini,基本就是个强化版的搜索引擎了。
Token Plan:一个黑盒好生意
Token正在成为继水、电、煤、云计算之后的又一个日常用品。云厂商纷纷推出看起来很便宜的Token Plan,但真实体验下来,ChatGPT和Claude的订阅反而更划算。而且很多Token Plan是个黑盒——用积分计价,积分与token的转换系数只有厂商自己知道,还可以随意控制。
DeepSeek Harness不止是一个Agent
亲测DeepSeek Harness:与Claude Code对比之后,发现DeepSeek自家Agent配上自家大模型更好用。它不止是一个Agent工具,更是开源、可以完全定制化成各种专用Agent产品的平台。