LLVM 24.0.0git
AMDGPULowerIntrinsics.cpp
Go to the documentation of this file.
1//===-- AMDGPULowerIntrinsics.cpp -------------------------------------------=//
2//
3// Part of the LLVM Project, under the Apache License v2.0 with LLVM Exceptions.
4// See https://llvm.org/LICENSE.txt for license information.
5// SPDX-License-Identifier: Apache-2.0 WITH LLVM-exception
6//
7//===----------------------------------------------------------------------===//
8//
9// Lower intrinsics that would otherwise require separate handling in both
10// SelectionDAG and GlobalISel.
11//
12//===----------------------------------------------------------------------===//
13
14#include "AMDGPU.h"
15#include "AMDGPUTargetMachine.h"
16#include "GCNSubtarget.h"
18#include "llvm/IR/IRBuilder.h"
20#include "llvm/IR/IntrinsicsAMDGPU.h"
23
24#define DEBUG_TYPE "amdgpu-lower-intrinsics"
25
26using namespace llvm;
27
28namespace {
29
30class AMDGPULowerIntrinsicsImpl {
31public:
32 Module &M;
33 const AMDGPUTargetMachine &TM;
34
35 AMDGPULowerIntrinsicsImpl(Module &M, const AMDGPUTargetMachine &TM)
36 : M(M), TM(TM) {}
37
38 bool run();
39
40private:
41 bool visitBarrier(IntrinsicInst &I);
42 bool visitPtrSBufferLoad(IntrinsicInst &I);
43 bool visitMonitorSleep(IntrinsicInst &I);
44 bool visitCvtScale(IntrinsicInst &I);
45};
46
47class AMDGPULowerIntrinsicsLegacy : public ModulePass {
48public:
49 static char ID;
50
51 AMDGPULowerIntrinsicsLegacy() : ModulePass(ID) {}
52
53 bool runOnModule(Module &M) override;
54
55 void getAnalysisUsage(AnalysisUsage &AU) const override {
57 }
58};
59
60template <class T> static void forEachCall(Function &Intrin, T Callback) {
61 for (User *U : make_early_inc_range(Intrin.users())) {
62 if (auto *CI = dyn_cast<IntrinsicInst>(U))
63 Callback(CI);
64 }
65}
66
67} // anonymous namespace
68
69bool AMDGPULowerIntrinsicsImpl::run() {
70 bool Changed = false;
71
72 for (Function &F : M) {
73 switch (F.getIntrinsicID()) {
74 default:
75 continue;
76 case Intrinsic::amdgcn_s_barrier:
77 case Intrinsic::amdgcn_s_barrier_signal:
78 case Intrinsic::amdgcn_s_barrier_signal_isfirst:
79 case Intrinsic::amdgcn_s_barrier_wait:
80 case Intrinsic::amdgcn_s_cluster_barrier:
81 forEachCall(F, [&](IntrinsicInst *II) { Changed |= visitBarrier(*II); });
82 break;
83 case Intrinsic::amdgcn_ptr_s_buffer_load:
85 F, [&](IntrinsicInst *II) { Changed |= visitPtrSBufferLoad(*II); });
86 break;
87 case Intrinsic::amdgcn_s_monitor_sleep:
89 F, [&](IntrinsicInst *II) { Changed |= visitMonitorSleep(*II); });
90 break;
91 case Intrinsic::amdgcn_cvt_scale_pk8_f16_fp8:
92 case Intrinsic::amdgcn_cvt_scale_pk8_bf16_fp8:
93 case Intrinsic::amdgcn_cvt_scale_pk8_f16_bf8:
94 case Intrinsic::amdgcn_cvt_scale_pk8_bf16_bf8:
95 case Intrinsic::amdgcn_cvt_scale_pk8_f16_fp4:
96 case Intrinsic::amdgcn_cvt_scale_pk8_bf16_fp4:
97 case Intrinsic::amdgcn_cvt_scale_pk8_f32_fp8:
98 case Intrinsic::amdgcn_cvt_scale_pk8_f32_bf8:
99 case Intrinsic::amdgcn_cvt_scale_pk8_f32_fp4:
100 case Intrinsic::amdgcn_cvt_scale_pk16_f16_bf6:
101 case Intrinsic::amdgcn_cvt_scale_pk16_bf16_bf6:
102 case Intrinsic::amdgcn_cvt_scale_pk16_f16_fp6:
103 case Intrinsic::amdgcn_cvt_scale_pk16_bf16_fp6:
104 case Intrinsic::amdgcn_cvt_scale_pk16_f32_fp6:
105 case Intrinsic::amdgcn_cvt_scale_pk16_f32_bf6:
106 forEachCall(F, [&](IntrinsicInst *II) { Changed |= visitCvtScale(*II); });
107 break;
108 }
109 }
110
111 return Changed;
112}
113
114// Optimize barriers and lower s_(cluster_)barrier to a sequence of split
115// barrier intrinsics.
116bool AMDGPULowerIntrinsicsImpl::visitBarrier(IntrinsicInst &I) {
117 assert(I.getIntrinsicID() == Intrinsic::amdgcn_s_barrier ||
118 I.getIntrinsicID() == Intrinsic::amdgcn_s_barrier_signal ||
119 I.getIntrinsicID() == Intrinsic::amdgcn_s_barrier_signal_isfirst ||
120 I.getIntrinsicID() == Intrinsic::amdgcn_s_barrier_wait ||
121 I.getIntrinsicID() == Intrinsic::amdgcn_s_cluster_barrier);
122
123 const GCNSubtarget &ST = TM.getSubtarget<GCNSubtarget>(*I.getFunction());
124 bool IsSingleWaveWG = false;
125
126 if (TM.getOptLevel() > CodeGenOptLevel::None) {
127 unsigned WGMaxSize = ST.getFlatWorkGroupSizes(*I.getFunction()).second;
128 IsSingleWaveWG = WGMaxSize <= ST.getWavefrontSize();
129 }
130
131 IRBuilder<> B(&I);
132
133 // Lower the s_cluster_barrier intrinsic first. There is no corresponding
134 // hardware instruction in any subtarget.
135 if (I.getIntrinsicID() == Intrinsic::amdgcn_s_cluster_barrier) {
136 // The default cluster barrier expects one signal per workgroup. So we need
137 // a workgroup barrier first.
138 if (IsSingleWaveWG) {
139 B.CreateIntrinsicWithoutFolding(B.getVoidTy(),
140 Intrinsic::amdgcn_wave_barrier, {})
141 ->copyMetadata(I);
142 } else {
143 Value *BarrierID_32 = B.getInt32(AMDGPU::Barrier::WORKGROUP);
144 Value *BarrierID_16 = B.getInt16(AMDGPU::Barrier::WORKGROUP);
145 CallInst *IsFirst = B.CreateIntrinsicWithoutFolding(
146 B.getInt1Ty(), Intrinsic::amdgcn_s_barrier_signal_isfirst,
147 {BarrierID_32});
148 IsFirst->copyMetadata(I);
149 B.CreateIntrinsicWithoutFolding(
150 B.getVoidTy(), Intrinsic::amdgcn_s_barrier_wait, {BarrierID_16})
151 ->copyMetadata(I);
152
153 Instruction *ThenTerm =
154 SplitBlockAndInsertIfThen(IsFirst, I.getIterator(), false);
155 B.SetInsertPoint(ThenTerm);
156 }
157
158 // Now we can signal the cluster barrier from a single wave and wait for the
159 // barrier in all waves.
160 Value *BarrierID_32 = B.getInt32(AMDGPU::Barrier::CLUSTER);
161 Value *BarrierID_16 = B.getInt16(AMDGPU::Barrier::CLUSTER);
162 B.CreateIntrinsicWithoutFolding(
163 B.getVoidTy(), Intrinsic::amdgcn_s_barrier_signal, {BarrierID_32})
164 ->copyMetadata(I);
165
166 B.SetInsertPoint(&I);
167 B.CreateIntrinsicWithoutFolding(
168 B.getVoidTy(), Intrinsic::amdgcn_s_barrier_wait, {BarrierID_16})
169 ->copyMetadata(I);
170
171 I.eraseFromParent();
172 return true;
173 }
174
175 bool IsWorkgroupScope = false;
176
177 if (I.getIntrinsicID() == Intrinsic::amdgcn_s_barrier_wait ||
178 I.getIntrinsicID() == Intrinsic::amdgcn_s_barrier_signal ||
179 I.getIntrinsicID() == Intrinsic::amdgcn_s_barrier_signal_isfirst) {
180 int BarrierID = cast<ConstantInt>(I.getArgOperand(0))->getSExtValue();
181 if (BarrierID == AMDGPU::Barrier::TRAP ||
182 BarrierID == AMDGPU::Barrier::WORKGROUP ||
185 IsWorkgroupScope = true;
186 else if (I.getIntrinsicID() == Intrinsic::amdgcn_s_barrier_signal_isfirst &&
187 BarrierID == AMDGPU::Barrier::CLUSTER) {
188 I.getContext().diagnose(
189 DiagnosticInfoUnsupported(*I.getFunction(),
190 "s_barrier_signal_isfirst does not support "
191 "user_cluster_barrier_id (-3)",
192 I.getDebugLoc()));
193 }
194 } else {
195 assert(I.getIntrinsicID() == Intrinsic::amdgcn_s_barrier);
196 IsWorkgroupScope = true;
197 }
198
199 if (IsWorkgroupScope && IsSingleWaveWG) {
200 // Down-grade waits, remove split signals.
201 if (I.getIntrinsicID() == Intrinsic::amdgcn_s_barrier ||
202 I.getIntrinsicID() == Intrinsic::amdgcn_s_barrier_wait) {
203 B.CreateIntrinsicWithoutFolding(B.getVoidTy(),
204 Intrinsic::amdgcn_wave_barrier, {})
205 ->copyMetadata(I);
206 } else if (I.getIntrinsicID() ==
207 Intrinsic::amdgcn_s_barrier_signal_isfirst) {
208 // If we're the only wave of the workgroup, we're always first.
209 I.replaceAllUsesWith(B.getInt1(true));
210 }
211 I.eraseFromParent();
212 return true;
213 }
214
215 if (I.getIntrinsicID() == Intrinsic::amdgcn_s_barrier &&
216 ST.hasSplitBarriers()) {
217 // Lower to split barriers.
218 Value *BarrierID_32 = B.getInt32(AMDGPU::Barrier::WORKGROUP);
219 Value *BarrierID_16 = B.getInt16(AMDGPU::Barrier::WORKGROUP);
220 B.CreateIntrinsicWithoutFolding(
221 B.getVoidTy(), Intrinsic::amdgcn_s_barrier_signal, {BarrierID_32})
222 ->copyMetadata(I);
223 B.CreateIntrinsicWithoutFolding(
224 B.getVoidTy(), Intrinsic::amdgcn_s_barrier_wait, {BarrierID_16})
225 ->copyMetadata(I);
226 I.eraseFromParent();
227 return true;
228 }
229
230 return false;
231}
232
233bool AMDGPULowerIntrinsicsImpl::visitPtrSBufferLoad(IntrinsicInst &I) {
234 assert(I.getIntrinsicID() == Intrinsic::amdgcn_ptr_s_buffer_load);
235
236 if (I.hasMetadata(LLVMContext::MD_invariant_load))
237 return false;
238
239 I.setMetadata(LLVMContext::MD_invariant_load,
240 MDNode::get(I.getContext(), {}));
241 return true;
242}
243
244bool AMDGPULowerIntrinsicsImpl::visitMonitorSleep(IntrinsicInst &I) {
245 assert(I.getIntrinsicID() == Intrinsic::amdgcn_s_monitor_sleep);
246
247 const GCNSubtarget &ST = TM.getSubtarget<GCNSubtarget>(*I.getFunction());
248 if (!ST.hasNoSleepForever())
249 return false;
250
251 int Sleep = cast<ConstantInt>(I.getArgOperand(0))->getSExtValue();
252 if (!(Sleep & 0x8000))
253 return false;
254
255 IRBuilder<> B(&I);
256 Value *NewSleep = B.getInt16(0x2000); // Maximum
257 I.setArgOperand(0, NewSleep);
258
259 return true;
260}
261
262bool AMDGPULowerIntrinsicsImpl::visitCvtScale(IntrinsicInst &I) {
263 int MaxSel = 0;
264 switch (I.getIntrinsicID()) {
265 default:
266 llvm_unreachable("expected cvt_scale_* intrinsic");
267 case Intrinsic::amdgcn_cvt_scale_pk8_f16_fp8:
268 case Intrinsic::amdgcn_cvt_scale_pk8_bf16_fp8:
269 case Intrinsic::amdgcn_cvt_scale_pk8_f16_bf8:
270 case Intrinsic::amdgcn_cvt_scale_pk8_bf16_bf8:
271 case Intrinsic::amdgcn_cvt_scale_pk8_f32_fp8:
272 case Intrinsic::amdgcn_cvt_scale_pk8_f32_bf8:
273 MaxSel = 8;
274 break;
275 case Intrinsic::amdgcn_cvt_scale_pk8_f16_fp4:
276 case Intrinsic::amdgcn_cvt_scale_pk8_bf16_fp4:
277 case Intrinsic::amdgcn_cvt_scale_pk8_f32_fp4:
278 case Intrinsic::amdgcn_cvt_scale_pk16_f16_bf6:
279 case Intrinsic::amdgcn_cvt_scale_pk16_bf16_bf6:
280 case Intrinsic::amdgcn_cvt_scale_pk16_f16_fp6:
281 case Intrinsic::amdgcn_cvt_scale_pk16_bf16_fp6:
282 case Intrinsic::amdgcn_cvt_scale_pk16_f32_fp6:
283 case Intrinsic::amdgcn_cvt_scale_pk16_f32_bf6:
284 MaxSel = 4;
285 break;
286 }
287
288 const GCNSubtarget &ST = TM.getSubtarget<GCNSubtarget>(*I.getFunction());
289 if (ST.hasBlock16ConversionScaleInsts())
290 MaxSel *= 2;
291
292 int ScaleSel = cast<ConstantInt>(I.getArgOperand(2))->getSExtValue();
293 if (ScaleSel < MaxSel)
294 return false;
295
296 I.getContext().diagnose(DiagnosticInfoUnsupported(
297 *I.getFunction(),
298 I.getCalledFunction()->getName() +
299 Twine(" scale_sel maximum supported value is ") + Twine(MaxSel - 1),
300 I.getDebugLoc()));
301
302 return false;
303}
304
307 AMDGPULowerIntrinsicsImpl Impl(M, TM);
308 if (!Impl.run())
309 return PreservedAnalyses::all();
311}
312
313bool AMDGPULowerIntrinsicsLegacy::runOnModule(Module &M) {
314 auto &TPC = getAnalysis<TargetPassConfig>();
315 const AMDGPUTargetMachine &TM = TPC.getTM<AMDGPUTargetMachine>();
316
317 AMDGPULowerIntrinsicsImpl Impl(M, TM);
318 return Impl.run();
319}
320
321#define PASS_DESC "AMDGPU lower intrinsics"
322INITIALIZE_PASS_BEGIN(AMDGPULowerIntrinsicsLegacy, DEBUG_TYPE, PASS_DESC, false,
323 false)
325INITIALIZE_PASS_END(AMDGPULowerIntrinsicsLegacy, DEBUG_TYPE, PASS_DESC, false,
326 false)
327
328char AMDGPULowerIntrinsicsLegacy::ID = 0;
329
331 return new AMDGPULowerIntrinsicsLegacy;
332}
assert(UImm &&(UImm !=~static_cast< T >(0)) &&"Invalid immediate!")
The AMDGPU TargetMachine interface definition for hw codegen targets.
static GCRegistry::Add< OcamlGC > B("ocaml", "ocaml 3.10-compatible GC")
AMD GCN specific subclass of TargetSubtarget.
#define DEBUG_TYPE
#define F(x, y, z)
Definition MD5.cpp:54
#define I(x, y, z)
Definition MD5.cpp:57
#define T
uint64_t IntrinsicInst * II
ModuleAnalysisManager MAM
#define INITIALIZE_PASS_DEPENDENCY(depName)
Definition PassSupport.h:42
#define INITIALIZE_PASS_END(passName, arg, name, cfg, analysis)
Definition PassSupport.h:44
#define INITIALIZE_PASS_BEGIN(passName, arg, name, cfg, analysis)
Definition PassSupport.h:39
static bool forEachCall(Function &Intrin, T Callback)
Represent the analysis usage information of a pass.
AnalysisUsage & addRequired()
LLVM_ABI void copyMetadata(const Instruction &SrcInst, ArrayRef< unsigned > WL=ArrayRef< unsigned >())
Copy metadata from SrcInst to this instruction.
A wrapper class for inspecting calls to intrinsic functions.
static MDTuple * get(LLVMContext &Context, ArrayRef< Metadata * > MDs)
Definition Metadata.h:1579
ModulePass class - This class is used to implement unstructured interprocedural optimizations and ana...
Definition Pass.h:255
A Module instance is used to store all the information related to an LLVM module.
Definition Module.h:68
A set of analyses that are preserved following a run of a transformation pass.
Definition Analysis.h:112
static PreservedAnalyses none()
Convenience factory function for the empty preserved set.
Definition Analysis.h:115
static PreservedAnalyses all()
Construct a special preserved set that preserves all passes.
Definition Analysis.h:118
CodeGenOptLevel getOptLevel() const
Returns the optimization level: None, Less, Default, or Aggressive.
const STC & getSubtarget(const Function &F) const
This method returns a pointer to the specified type of TargetSubtargetInfo.
Target-Independent Code Generator Pass Configuration Options.
iterator_range< user_iterator > users()
Definition Value.h:428
Changed
#define llvm_unreachable(msg)
Marks that the current location is not supposed to be reachable.
friend class Instruction
Iterator for Instructions in a `BasicBlock.
Definition BasicBlock.h:73
This is an optimization pass for GlobalISel generic memory operations.
decltype(auto) dyn_cast(const From &Val)
dyn_cast<X> - Return the argument parameter cast to the specified type.
Definition Casting.h:643
iterator_range< early_inc_iterator_impl< detail::IterOfRange< RangeT > > > make_early_inc_range(RangeT &&Range)
Make a range that does early increment to allow mutation of the underlying range without disrupting i...
Definition STLExtras.h:649
RelativeUniformCounterPtr ValuesPtrExpr VTableAddr Value
Definition InstrProf.h:143
ModulePass * createAMDGPULowerIntrinsicsLegacyPass()
IRBuilder(LLVMContext &, FolderTy, InserterTy) -> IRBuilder< FolderTy, InserterTy >
decltype(auto) cast(const From &Val)
cast<X> - Return the argument parameter cast to the specified type.
Definition Casting.h:559
LLVM_ABI Instruction * SplitBlockAndInsertIfThen(Value *Cond, BasicBlock::iterator SplitBefore, bool Unreachable, MDNode *BranchWeights=nullptr, DomTreeUpdater *DTU=nullptr, LoopInfo *LI=nullptr, BasicBlock *ThenBlock=nullptr)
Split the containing block at the specified instruction - everything before SplitBefore stays in the ...
AnalysisManager< Module > ModuleAnalysisManager
Convenience typedef for the Module analysis manager.
Definition MIRParser.h:39
PreservedAnalyses run(Module &M, ModuleAnalysisManager &MAM)