两两对决显微镜:如何用liars-bar-llm的player_matchup_analyze提取AI间的 bluff 风格画像

发布时间:2026/8/23 13:08:34
两两对决显微镜:如何用liars-bar-llm的player_matchup_analyze提取AI间的 bluff 风格画像 两两对决显微镜如何用liars-bar-llm的player_matchup_analyze提取AI间的 bluff 风格画像【免费下载链接】liars-bar-llm一个由大语言模型驱动的AI版骗子酒馆对战框架项目地址: https://gitcode.com/gh_mirrors/li/liars-bar-llmliars-bar-llm 是一个由大语言模型LLM驱动的 AI「骗子酒馆」bluff 对战框架多个 AI 模型像真人一样用卡牌互骗、互相质疑。本文聚焦它的分析工具player_matchup_analyze.py手把手教你从对战数据中提取AI vs AI的两两对决记录并为每个模型画出一张 bluff虚张声势风格画像——适合想做 LLM 行为分析的初学者。先看懂舞台liars-bar-llm 在做什么项目让多个 LLM 坐上牌桌玩一场生死游戏核心规则非常简一副 20 张牌6 张 Q、6 张 K、6 张 A外加 2 张万能 Joker2~4 名玩家每轮各发 5 张牌随机抽一张作为目标牌玩家轮流出 1~3 张牌并宣称它们是目标牌——可以撒谎下家可以选择质疑质疑成功出牌者罚枪质疑失败质疑者罚枪每人一把 6 弹仓、装 1 发实弹的左轮手枪存活到最后者获胜。完整规则见prompt/rule_base.txt。项目分为游戏主体game.py、player.py、game_record.py、llm_client.py、multi_game_runner.py和分析工具player_matchup_analyze.py、game_analyze.py、json_convert.py两部分。仓库已内置官方 DemoDeepSeek-R1、o3-mini、Gemini-2-flash-thinking、Claude-3.7-Sonnet 四个模型对战 50 局记录在demo_records文件夹中可以零成本直接上手分析。分析流水线从 JSON 到两两对决画像数据流向一目了然multi_game_runner.py 批量跑局 ↓ game_records/*.json 原始游戏记录每局一个文件 ↓ json_convert.py → converted_game_records/*.txt 全流程可读文本 ↓ player_matchup_analyze.py → matchup_records/*.txt 两两对决显微镜player_matchup_analyze.py是整个流程的终点它把所有局里发生质疑的瞬间单独挑出来按玩家两两配对归档形成每个 AI 组合专属的对决档案。快速上手一条命令提取两两对决记录1️⃣ 获取代码git clone https://gitcode.com/gh_mirrors/li/liars-bar-llm2️⃣ 准备数据把若干局的 JSON 记录放入game_records文件夹也可以直接看demo_records/game_records下的官方 50 局数据。分析脚本只用 Python 标准库不需要配置任何 API Key。3️⃣ 运行python player_matchup_analyze.py脚本内部逻辑分三步源码见 player_matchup_analyze.py读取game_records下所有 JSON 对局筛选只保留was_challenged为真的出牌事件并用排序后的玩家名生成配对键——A vs B 与 B vs A 归入同一对合并输出同一对玩家跨所有局记录合并到matchup_records/{A}_vs_{B}_detailed_matchups.txt文件末尾自动附上总计对决次数。官方 Demo 的产出是 6 个配对文件单对对决 43~146 次合计约 1.1 万行——样本量足够做风格归纳。读懂对决记录每条记录的 6 个关键字段打开任一文件每条对决长这样摘自demo_records/matchup_records/Claude_vs_DeepSeek_detailed_matchups.txt第 6 轮对决 目标牌: K 游戏ID: 20250225_095738 出牌方 (Claude): 初始手牌: A, Q, Q, K, Joker 打出牌: Q, Q 剩余手牌: A, K, Joker 出牌理由: 选择打出两张Q而非真实的K是一个高风险高收益的策略…… 出牌表现: 缓慢地抽出两张牌嘴角露出一丝几不可见的微笑…… 质疑方 (DeepSeek): 初始手牌: K, Joker, K, Q, K 发起质疑 质疑理由: Claude的剩余手牌结构3张与其宣称的2张K存在矛盾…… 质疑结果: 成功字段画像价值游戏ID可回溯到game_records里的原始 JSON 局目标牌本轮博弈的核心双方初始手牌决策时的全部已知信息便于复盘是否算错打出牌 / 剩余手牌 出牌理由出牌者的宣称与决策过程bluff 意图常在此暴露出牌表现LLM 用角色扮演生成的微表情是读牌信号质疑理由 质疑结果质疑方的判断依据且结果可验证对错提炼 bluff 风格画像基于官方 Demo 的示范方法很简单通读某对文件把每个模型的出牌理由和质疑理由按挑战倾向 / 决策依据 / 表演风格 / 明显弱点四个维度归纳。以官方 50 局 Demo 为例可以提炼出这样的画像卡模型bluff 风格关键词典型决策语言DeepSeek概率计算、精准质疑、牌池统计概率高达78%贝叶斯修正后仅为32.7%脆弱窗口期Claude行为角色扮演、心理干扰、模仿对手手指在牌面上轻轻敲击两下模仿ChatGPT的出牌数量Gemini先观察后行动、动态适配对手首轮真实出牌观察DeepSeek的反应ChatGPT读夸张表演 概率判断表现和言辞过于夸张透出掩饰不确定性的强势气场几个有代表性的发现DeepSeek 是概率狙击手质疑理由几乎都带具体数字——牌池余量、Joker 分布、存活压力先算账再开枪Claude 是心理操纵者出牌理由中反复出现诱导对方质疑甚至刻意模仿对手的出牌节奏来伪装有趣的 bug 也是画像Gemini 的质疑理由偶尔会整段切换成英文这种语言漂移本身就是它风格的注脚Claude vs DeepSeek 的 57 次对决中表演与算牌两种范式的互博胜负参半——说明风格画像能直接预测对局观感。组合使用补齐全局视角player_matchup_analyze.py聚焦质疑瞬间适合定性画像搭配另外两个工具可形成完整闭环python json_convert.py把单局转成全程可读文本输出到converted_game_records适合逐回合精读一手资料python game_analyze.py统计全局量化数据——各模型胜场、开枪次数、存活点数与两两对决次数用数字校准你从对决档案里得出的印象。 小建议画像前最好自己再跑一批局python multi_game_runner.py -n 20。官方 Demo 是 50 局产出单对 43~146 次对决样本越多风格画像越可信。小结player_matchup_analyze.py就像一台装在 AI 牌桌上的显微镜它把散落在几十局对战中的质疑瞬间按对手配对、带上完整决策理由归档让你用读人的方式读懂每个大模型的 bluff 风格。下次想比较两个模型的博弈性格跑一条命令然后开始对号入座就好。【免费下载链接】liars-bar-llm一个由大语言模型驱动的AI版骗子酒馆对战框架项目地址: https://gitcode.com/gh_mirrors/li/liars-bar-llm创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻